diff --git a/.gitattributes b/.gitattributes
new file mode 100644
index 0000000..c8ebd75
--- /dev/null
+++ b/.gitattributes
@@ -0,0 +1,12 @@
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+*.gguf filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.tiktoken filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text
+vocab.json filter=lfs diff=lfs merge=lfs -text
+merges.txt filter=lfs diff=lfs merge=lfs -text
diff --git a/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/Qwen3.5-0.8B-Q4_K_M.gguf b/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/Qwen3.5-0.8B-Q4_K_M.gguf
new file mode 100644
index 0000000..e18ef50
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/Qwen3.5-0.8B-Q4_K_M.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:bd258782e35f7f458f8aced1adc053e6e92e89bc735ba3be89d38a06121dc517
+size 532517120
diff --git a/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/README.md b/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/README.md
new file mode 100644
index 0000000..a2a3a7c
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/README.md
@@ -0,0 +1,996 @@
+---
+tags:
+- unsloth
+library_name: transformers
+license: apache-2.0
+license_link: https://huggingface.co/Qwen/Qwen3.5-0.8B/blob/main/LICENSE
+pipeline_tag: image-text-to-text
+base_model:
+- Qwen/Qwen3.5-0.8B
+---
+
+
+
+
+
+ Unsloth Dynamic 2.0 achieves superior accuracy & outperforms other leading quants.
+
+
+
+
+- You can now also fine-tune the model locally with [Unsloth](https://github.com/unslothai/unsloth).
+- Read our [Qwen3.5 fine-tuning guide here](https://unsloth.ai/docs/models/qwen3.5/fine-tune).
+
+---
+
+# Qwen3.5-0.8B
+
+
+
+[](https://chat.qwen.ai)
+
+> [!Note]
+> This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format.
+>
+> These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, KTransformers, etc.
+>
+> In light of its parameter scale, the intended use cases are prototyping, task-specific fine-tuning, and other research or development purposes.
+
+Over recent months, we have intensified our focus on developing foundation models that deliver exceptional utility and performance. Qwen3.5 represents a significant leap forward, integrating breakthroughs in multimodal learning, architectural efficiency, reinforcement learning scale, and global accessibility to empower developers and enterprises with unprecedented capability and efficiency.
+
+## Qwen3.5 Highlights
+
+Qwen3.5 features the following enhancement:
+
+- **Unified Vision-Language Foundation**: Early fusion training on multimodal tokens achieves cross-generational parity with Qwen3 and outperforms Qwen3-VL models across reasoning, coding, agents, and visual understanding benchmarks.
+
+- **Efficient Hybrid Architecture**: Gated Delta Networks combined with sparse Mixture-of-Experts deliver high-throughput inference with minimal latency and cost overhead.
+
+- **Scalable RL Generalization**: Reinforcement learning scaled across million-agent environments with progressively complex task distributions for robust real-world adaptability.
+
+- **Global Linguistic Coverage**: Expanded support to 201 languages and dialects, enabling inclusive, worldwide deployment with nuanced cultural and regional understanding.
+
+- **Next-Generation Training Infrastructure**: Near-100% multimodal training efficiency compared to text-only training and asynchronous RL frameworks supporting massive-scale agent scaffolds and environment orchestration.
+
+For more details, please refer to our blog post [Qwen3.5](https://qwen.ai/blog?id=qwen3.5).
+
+
+## Model Overview
+
+- Type: Causal Language Model with Vision Encoder
+- Training Stage: Pre-training & Post-training
+- Language Model
+ - Number of Parameters: 0.8B
+ - Hidden Dimension: 1024
+ - Token Embedding: 248320 (Padded)
+ - Number of Layers: 24
+ - Hidden Layout: 6 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))
+ - Gated DeltaNet:
+ - Number of Linear Attention Heads: 16 for V and 16 for QK
+ - Head Dimension: 128
+ - Gated Attention:
+ - Number of Attention Heads: 8 for Q and 2 for KV
+ - Head Dimension: 256
+ - Rotary Position Embedding Dimension: 64
+ - Feed Forward Network:
+ - Intermediate Dimension: 3584
+ - LM Output: 248320 (Tied to token embedding)
+ - MTP: trained with multi-steps
+- Context Length: 262,144 natively
+
+## Benchmark Results
+
+### Language
+
+
+
+
+Qwen3-4B-2507 Qwen3-1.7B Qwen3.5-2B Qwen3.5-0.8B
+
+Non-Thinking Mode
+
+MMLU-Pro
+69.6
+40.2
+55.3
+29.7
+
+
+MMLU-Redux
+84.2
+64.4
+69.2
+48.5
+
+
+C-Eval
+80.2
+61.0
+65.2
+46.4
+
+
+SuperGPQA
+42.8
+21.0
+30.4
+16.9
+
+
+IFEval
+83.4
+68.2
+61.2
+52.1
+
+
+MMMLU
+64.9
+46.7
+56.9
+34.1
+
+Knowledge & STEM (Thinking)
+
+MMLU-Pro
+74.0
+56.5
+66.5
+42.3
+
+
+MMLU-Redux
+86.1
+73.9
+79.6
+59.5
+
+
+C-Eval
+82.2
+68.1
+73.2
+50.5
+
+
+SuperGPQA
+47.8
+31.2
+37.5
+21.3
+
+
+GPQA
+65.8
+40.1
+51.6
+11.9
+
+Instruction Following (Thinking)
+
+IFEval
+87.4
+72.5
+78.6
+44.0
+
+
+IFBench
+50.4
+26.7
+41.3
+21.0
+
+
+MultiChallenge
+41.7
+27.2
+33.7
+18.9
+
+Long Context (Thinking)
+
+AA-LCR
+32.0
+6.7
+25.6
+4.7
+
+
+LongBench v2
+42.8
+26.5
+38.7
+26.1
+
+Reasoning (Thinking)
+
+HMMT Feb 25
+57.5
+10.2
+22.9
+--
+
+
+HMMT Nov 25
+69.6
+8.9
+19.6
+--
+
+General Agent (Thinking)
+
+BFCL-V4
+39.9
+--
+43.6
+25.3
+
+
+TAU2-Bench
+43.2
+--
+48.8
+11.6
+
+Multilingualism (Thinking)
+
+MMMLU
+70.8
+57.0
+63.1
+44.3
+
+
+MMLU-ProX
+62.4
+49.4
+52.3
+34.6
+
+
+NOVA-63
+47.1
+40.3
+46.4
+42.4
+
+
+INCLUDE
+64.4
+51.8
+55.4
+40.6
+
+
+Global PIQA
+73.5
+63.1
+69.3
+59.4
+
+
+PolyMATH
+46.2
+25.2
+26.1
+8.2
+
+
+WMT24++
+58.9
+39.3
+45.8
+27.2
+
+
+MAXIFE
+72.1
+50.7
+60.6
+39.2
+
+
+
+
+* TAU2-Bench: we follow the official setup except for the airline domain, where all models are evaluated by applying the fixes proposed in the Claude Opus 4.5 system card.
+
+* MMLU-ProX: we report the averaged accuracy on 29 languages.
+* WMT24++: a harder subset of WMT24 after difficulty labeling and rebalancing; we report the averaged scores on 55 languages using XCOMET-XXL.
+* MAXIFE: we report the accuracy on English + multilingual original prompts (totally 23 settings).
+* Experimental settings: top_p=0.95, top_k=20, presence_penalty=1.5, and temperature=1.0 were used.
+* Empty cells (--) indicate scores not yet available or not applicable.
+
+
+
+### Vision Language
+
+
+
+
+
+Qwen3-VL-4B Qwen3-VL-2B Qwen3.5-2B Qwen3.5-0.8B
+
+STEM and Puzzle
+
+MMMU
+70.8
+61.4
+64.2/64.2
+49/47.4
+
+
+MMMU-Pro
+57.0
+42.5
+50.3/47.7
+31.2/31.4
+
+
+Mathvista(mini)
+79.5
+73.6
+76.7/73.9
+62.2/58.6
+
+
+DynaMath
+74.4
+66.7
+73.6/69.6
+49.9/46.5
+
+
+ZEROBench
+0.0
+0.0
+1.0/0.0
+0.0/0.0
+
+
+ZEROBench_sub
+18.9
+13.2
+17.1/18.6
+12.9/11.4
+
+
+VlmsAreBlind
+68.6
+50.0
+75.8/74.3
+59.4/57.3
+
+General VQA
+
+RealWorldQA
+73.2
+69.5
+74.5/71.2
+63.4/61.6
+
+
+MMStar
+73.2
+68.1
+71.7/68.0
+58.3/55.9
+
+
+MMBenchEN-DEV-v1.1
+86.7
+81.9
+83.3/81.3
+69.9/68.0
+
+
+SimpleVQA
+48.8
+43.6
+38.5/39.5
+31.3/30.4
+
+
+HallusionBench
+64.1
+54.9
+58.0/51.3
+53.1/46.7
+
+Text Recognition and Document Understanding
+
+MMLongBench-Doc
+44.4
+33.8
+45.4/38.8
+33.6/28.1
+
+
+AI2D_TEST
+84.9
+80.4
+83.3/81.5
+69.9/68.7
+
+
+CC-OCR
+73.8
+68.3
+72.9/75.8
+63.2/66.7
+
+
+OmniDocBench1.5
+80.0
+65.9
+79.8/80.9
+61.0/70.6
+
+
+CharXiv(RQ)
+50.3
+37.1
+58.8/52.6
+41.3/38.2
+
+
+OCRBench
+80.8
+79.2
+84.5/85.4
+74.5/79.1
+
+Spatial Intelligence
+
+RefCOCO(avg)
+88.2
+84.8
+84.8/84.3
+79.3/77.8
+
+
+CountBench
+89.4
+84.1
+91.4/86.8
+77.0/68.6
+
+
+ODInW13
+39.4
+36.0
+35.9/40.5
+31.6/33.2
+
+
+ERQA
+47.3
+41.8
+43.8/33.0
+34.5/23.8
+
+
+EmbSpatialBench
+80.7
+75.9
+77.9/66.4
+68.6/54.6
+
+
+RefSpatialBench
+45.3
+28.9
+32.9/30.0
+23.5/21.7
+
+
+Hypersim
+11.9
+11.2
+12.4/12.4
+11.9/11.0
+
+
+SUNRGBD
+28.0
+28.6
+28.7/25.6
+26.1/23.3
+
+
+Nuscene
+4.9
+4.0
+6.9/8.5
+5.7/7.0
+
+Video Understanding
+
+VideoMME(w sub.)
+76.0
+67.9
+75.6/--
+63.8/--
+
+
+VideoMME(w/o sub.)
+68.9
+62.1
+69.0/--
+57.7/--
+
+
+VideoMMMU
+69.4
+54.1
+62.1/--
+44.3/--
+
+
+MLVU
+75.7
+69.2
+76.2/--
+65.6/--
+
+
+MVBench
+69.3
+64.5
+64.9/--
+55.8/--
+
+
+LVBench
+53.5
+47.6
+57.1/--
+45.1/--
+
+
+MMVU
+58.6
+48.9
+48.6/--
+34.3/--
+
+Visual Agent
+
+ScreenSpot Pro
+59.5
+48.5
+--/54.5
+--/46.5
+
+Medical VQA
+
+SLAKE
+65.9
+61.1
+74.4/67.5
+62.6/59.5
+
+
+PMC-VQA
+48.4
+42.4
+48.8/54.0
+40.4/45.5
+
+
+MedXpertQA-MM
+26.3
+13.0
+26.9/19.1
+17.1/25.3
+
+
+
+
+
+* Scores of Qwen3.5 models are reported as Thinking / Non-thinking.
+* MathVision: our model’s score is evaluated using a fixed prompt, e.g., “Please reason step by step, and put your final answer within \boxed{}.” For other models, we report the higher score between runs with and without the \boxed{} formatting.
+* Experimental settings: For the Video benchmarks, we used top_p=0.95, top_k=20, presence_penalty=1.5, and temperature=1.0. All other benchmarks adopted the same sampling configuration but with temperature=0.6 under the thinking mode. Under the non-thinking mode, the sampling parameters were set to top_p=0.8, top_k=20, presence_penalty=1.5, and temperature=0.7.
+* Empty cells (--) indicate scores not yet available or not applicable.
+
+
+
+## Quickstart
+
+> [!Important]
+> Qwen3.5 models support both non-thinking and thinking mode. **Qwen3.5-0.8B operates in non-thinking mode by default**.
+> To enable thinking, refer to the examples [here](#thinking-mode).
+
+For streamlined integration, we recommend using Qwen3.5 via APIs. Below is a guide to use Qwen3.5 via OpenAI-compatible API.
+
+### Serving Qwen3.5
+
+Qwen3.5 can be served via APIs with popular inference frameworks.
+In the following, we show example commands to launch OpenAI-Compatible API servers for Qwen3.5 models.
+
+> [!Important]
+> Inference efficiency and throughput vary significantly across frameworks.
+> We recommend using the latest framework versions to ensure optimal performance and compatibility.
+> For production workloads or high-throughput scenarios, dedicated serving engines such as SGLang, KTransformers or vLLM are strongly recommended.
+
+> [!Important]
+> The model has a default context length of 262,144 tokens.
+> If you encounter out-of-memory (OOM) errors, consider reducing the context window.
+
+#### SGLang
+
+[SGLang](https://github.com/sgl-project/sglang) is a fast serving framework for large language models and vision language models.
+SGLang from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment:
+```shell
+uv pip install 'git+https://github.com/sgl-project/sglang.git#subdirectory=python&egg=sglang[all]'
+```
+See [its documentation](https://docs.sglang.ai/get_started/install.html) for more details.
+
+The following will create API endpoints at `http://localhost:8000/v1`:
+
+- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs.
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.5-0.8B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144
+ ```
+
+- **Tool Use**: To support tool use, you can use the following command.
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.5-0.8B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --tool-call-parser qwen3_coder
+ ```
+
+- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP:
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.5-0.8B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --speculative-algo NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4
+ ```
+
+#### vLLM
+
+[vLLM](https://github.com/vllm-project/vllm) is a high-throughput and memory-efficient inference and serving engine for LLMs.
+vLLM from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment:
+```shell
+uv pip install vllm --torch-backend=auto --extra-index-url https://wheels.vllm.ai/nightly
+```
+See [its documentation](https://docs.vllm.ai/en/stable/getting_started/installation/index.html) for more details.
+
+For detailed Qwen3.5 usage guide, see the [vLLM Qwen3.5 recipe](https://docs.vllm.ai/projects/recipes/en/latest/Qwen/Qwen3.5.html).
+
+The following will create API endpoints at `http://localhost:8000/v1`:
+
+- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs.
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-0.8B --port 8000 --tensor-parallel-size 1 --max-model-len 262144
+ ```
+
+- **Tool Call**: To support tool use, you can use the following command.
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-0.8B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --enable-auto-tool-choice --tool-call-parser qwen3_coder
+ ```
+
+- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP:
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-0.8B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}'
+ ```
+
+- **Text-Only**: The following command skips the vision encoder and multimodal profiling to free up memory for additional KV cache:
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-0.8B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --language-model-only
+ ```
+
+#### KTransformers
+
+[KTransformers](https://github.com/kvcache-ai/ktransformers) is a flexible framework for experiencing cutting-edge LLM inference optimizations with CPU-GPU heterogeneous computing.
+For running Qwen3.5 with KTransformers, see the [KTransformers Deployment Guide](https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/Qwen3.5.md).
+
+#### Hugging Face Transformers
+
+Hugging Face Transformers contains a _lightweight_ server which can be used for quick testing and moderate load deployment.
+The latest `transformers` is required for Qwen3.5:
+```shell
+pip install "transformers[serving] @ git+https://github.com/huggingface/transformers.git@main"
+```
+See [its documentation](https://huggingface.co/docs/transformers/main/serving) for more details. Please also make sure torchvision and pillow are installed.
+
+Then, run `transformers serve` to launch a server with API endpoints at `http://localhost:8000/v1`; it will place the model on accelerators if available:
+```shell
+transformers serve --force-model Qwen/Qwen3.5-0.8B --port 8000 --continuous-batching
+```
+
+### Using Qwen3.5 via the Chat Completions API
+
+The chat completions API is accessible via standard HTTP requests or OpenAI SDKs.
+Here, we show examples using the OpenAI Python SDK.
+
+Before starting, make sure it is installed and the API key and the API base URL is configured, e.g.:
+```shell
+pip install -U openai
+
+# Set the following accordingly
+export OPENAI_BASE_URL="http://localhost:8000/v1"
+export OPENAI_API_KEY="EMPTY"
+```
+
+> [!Tip]
+> We recommend using the following set of sampling parameters for generation
+> - Non-thinking mode for text tasks: `temperature=1.0, top_p=1.00, top_k=20, min_p=0.0, presence_penalty=2.0, repetition_penalty=1.0`
+> - Non-thinking mode for VL tasks: `temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0`
+> - Thinking mode for text tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0`
+> - Thinking mode for VL or precise coding (e.g. WebDev) tasks : `temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0`
+>
+> Please note that the support for sampling parameters varies according to inference frameworks.
+
+#### Text-Only Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {"role": "user", "content": "Give me a short introduction to large language models."},
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-0.8B",
+ messages=messages,
+ max_tokens=32768,
+ temperature=1.0,
+ top_p=1.0,
+ presence_penalty=2.0,
+ extra_body={
+ "top_k": 20,
+ },
+)
+print("Chat response:", chat_response)
+```
+
+#### Image Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {
+ "type": "image_url",
+ "image_url": {
+ "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/RealWorld/RealWorld-04.png"
+ }
+ },
+ {
+ "type": "text",
+ "text": "Where is this?"
+ }
+ ]
+ }
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-0.8B",
+ messages=messages,
+ max_tokens=32768,
+ temperature=0.7,
+ top_p=0.8,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ },
+)
+print("Chat response:", chat_response)
+```
+
+#### Video Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {
+ "type": "video_url",
+ "video_url": {
+ "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4"
+ }
+ },
+ {
+ "type": "text",
+ "text": "Summarize the video content."
+ }
+ ]
+ }
+]
+
+# When vLLM is launched with `--media-io-kwargs '{"video": {"num_frames": -1}}'`,
+# video frame sampling can be configured via `extra_body` (e.g., by setting `fps`).
+# This feature is currently supported only in vLLM.
+#
+# By default, `fps=2` and `do_sample_frames=True`.
+# With `do_sample_frames=True`, you can customize the `fps` value to set your desired video sampling rate.
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-0.8B",
+ messages=messages,
+ max_tokens=32768,
+ temperature=0.7,
+ top_p=0.8,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True},
+ },
+)
+
+print("Chat response:", chat_response)
+```
+
+#### Thinking Mode
+
+> [!Important]
+> Qwen3.5 does not officially support the soft switch of Qwen3, i.e., `/think` and `/nothink`.
+
+You can make the model think before response by configuring the API parameters.
+For example,
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {"role": "user", "content": "Type \"I love Qwen3.5\" backwards"},
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-0.8B",
+ messages=messages,
+ max_tokens=81920,
+ temperature=1.0,
+ top_p=0.95,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ "enable_thinking": True,
+ },
+)
+print("Chat response:", chat_response)
+```
+
+> [!Important]
+> In thinking mode, we have observed that when using the recommended sampling parameters, Qwen3.5-0.8B is more prone to entering thinking loops compared to other Qwen3.5 models, which may prevent it from terminating generation properly.
+> We recommend further tuning the sampling parameters specific to your use case and utilizing the API's streaming generation mode (if supported) to enable timely detection and interruption of such anomalous generation behaviors.
+
+
+## Agentic Usage
+
+Qwen3.5 excels in tool calling capabilities.
+
+### Qwen-Agent
+
+We recommend using [Qwen-Agent](https://github.com/QwenLM/Qwen-Agent) to quickly build Agent applications with Qwen3.5.
+
+To define the available tools, you can use the MCP configuration file, use the integrated tool of Qwen-Agent, or integrate other tools by yourself.
+```python
+import os
+from qwen_agent.agents import Assistant
+
+# Define LLM
+# Using OpenAI-compatible API endpoint. The API backend should disable response parsers.
+llm_cfg = {
+ # Use your own model service compatible with OpenAI API by vLLM/SGLang:
+ 'model': 'Qwen/Qwen3.5-0.8B',
+ 'model_type': 'qwenvl_oai',
+ 'model_server': 'http://localhost:8000/v1', # api_base
+ 'api_key': 'EMPTY',
+
+ 'generate_cfg': {
+ 'use_raw_api': True,
+ # Pass the parameter of whether to enable thinking mode in this way
+ # 'extra_body': {
+ # 'chat_template_kwargs': {'enable_thinking': True}
+ # },
+ },
+}
+
+# Define Tools
+tools = [
+ {'mcpServers': { # You can specify the MCP configuration file
+ "filesystem": {
+ "command": "npx",
+ "args": ["-y", "@modelcontextprotocol/server-filesystem", "/Users/xxxx/Desktop"]
+ }
+ }
+ }
+]
+
+# Define Agent
+bot = Assistant(llm=llm_cfg, function_list=tools)
+
+# Streaming generation
+messages = [{'role': 'user', 'content': 'Help me organize my desktop.'}]
+for responses in bot.run(messages=messages):
+ pass
+print(responses)
+
+# Streaming generation
+messages = [{'role': 'user', 'content': 'Develop a dog website and save it on the desktop'}]
+for responses in bot.run(messages=messages):
+ pass
+print(responses)
+```
+
+### Qwen Code
+
+
+[Qwen Code](https://github.com/QwenLM/qwen-code) is an open-source AI agent for the terminal, optimized for Qwen models. It helps you understand large codebases, automate tedious work, and ship faster.
+
+For more information, please refer to [Qwen Code](https://qwenlm.github.io/qwen-code-docs/).
+
+## Best Practices
+
+To achieve optimal performance, we recommend the following settings:
+
+1. **Sampling Parameters**:
+ - We suggest using the following sets of sampling parameters depending on the mode and task type:
+ - **Non-thinking mode for text tasks**:
+ `temperature=1.0`, `top_p=1.00`, `top_k=20`, `min_p=0.0`, `presence_penalty=2.0`, `repetition_penalty=1.0`
+ - **Non-thinking mode for VL tasks**:
+ `temperature=0.7`, `top_p=0.80`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0`
+ - **Thinking mode for text tasks**:
+ `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0`
+ - **Thinking mode for VL or precise coding (e.g., WebDev) tasks**:
+ `temperature=0.6`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0`
+
+ - For supported frameworks, you can adjust the `presence_penalty` parameter between 0 and 2 to reduce endless repetitions. However, using a higher value may occasionally result in language mixing and a slight decrease in model performance.
+
+2. **Adequate Output Length**: We recommend using an output length of 32,768 tokens for most queries. For benchmarking on highly complex problems, such as those found in math and programming competitions, we suggest setting the max output length to 81,920 tokens. This provides the model with sufficient space to generate detailed and comprehensive responses, thereby enhancing its overall performance.
+
+3. **Standardize Output Format**: We recommend using prompts to standardize model outputs when benchmarking.
+ - **Math Problems**: Include "Please reason step by step, and put your final answer within \boxed{}." in the prompt.
+ - **Multiple-Choice Questions**: Add the following JSON structure to the prompt to standardize responses: "Please show your choice in the `answer` field with only the choice letter, e.g., `"answer": "C"`."
+
+4. **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final output part and does not need to include the thinking content. It is implemented in the provided chat template in Jinja2. However, for frameworks that do not directly use the Jinja2 chat template, it is up to the developers to ensure that the best practice is followed.
+
+5. **Long Video Understanding**: To optimize inference efficiency for plain text and images, the `size` parameter in the released `video_preprocessor_config.json` is conservatively configured. It is recommended to set the `longest_edge` parameter in the video_preprocessor_config file to 469,762,048 (corresponding to 224k video tokens) to enable higher frame-rate sampling for hour-scale videos and thereby achieve superior performance. For example,
+ ```json
+ {"longest_edge": 469762048, "shortest_edge": 4096}
+ ```
+
+ Alternatively, override the default values via engine startup parameters. For implementation details, refer to: [vLLM](https://github.com/vllm-project/vllm/pull/34330) / [SGLang](https://github.com/sgl-project/sglang/pull/18467).
+
+
+### Citation
+
+If you find our work helpful, feel free to give us a cite.
+
+```bibtex
+@misc{qwen3.5,
+ title = {{Qwen3.5}: Towards Native Multimodal Agents},
+ author = {{Qwen Team}},
+ month = {February},
+ year = {2026},
+ url = {https://qwen.ai/blog?id=qwen3.5}
+}
+```
\ No newline at end of file
diff --git a/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/mmproj-F16.gguf
new file mode 100644
index 0000000..5e51ff9
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/mmproj-F16.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:56e4c6cfe73b0c82e3e82bc518d7591997e61d81f723fc41a586f4fa69ea2453
+size 204987232
diff --git a/chat/gguf/unsloth/Qwen3.5-2B-GGUF/Qwen3.5-2B-Q4_K_M.gguf b/chat/gguf/unsloth/Qwen3.5-2B-GGUF/Qwen3.5-2B-Q4_K_M.gguf
new file mode 100644
index 0000000..2dd42a9
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.5-2B-GGUF/Qwen3.5-2B-Q4_K_M.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:aaf42c8b7c3cab2bf3d69c355048d4a0ee9973d48f16c731c0520ee914699223
+size 1280835840
diff --git a/chat/gguf/unsloth/Qwen3.5-2B-GGUF/README.md b/chat/gguf/unsloth/Qwen3.5-2B-GGUF/README.md
new file mode 100644
index 0000000..2780db4
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.5-2B-GGUF/README.md
@@ -0,0 +1,1033 @@
+---
+tags:
+- unsloth
+library_name: transformers
+license: apache-2.0
+license_link: https://huggingface.co/Qwen/Qwen3.5-2B/blob/main/LICENSE
+pipeline_tag: image-text-to-text
+base_model:
+- Qwen/Qwen3.5-2B
+---
+
+
+
+
+
+ Unsloth Dynamic 2.0 achieves superior accuracy & outperforms other leading quants.
+
+
+
+
+- You can now also fine-tune the model locally with [Unsloth](https://github.com/unslothai/unsloth).
+- Read our [Qwen3.5 fine-tuning guide here](https://unsloth.ai/docs/models/qwen3.5/fine-tune).
+
+---
+
+# Qwen3.5-2B
+
+
+
+[](https://chat.qwen.ai)
+
+> [!Note]
+> This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format.
+>
+> These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, KTransformers, etc.
+>
+> In light of its parameter scale, the intended use cases are prototyping, task-specific fine-tuning, and other research or development purposes.
+
+
+Over recent months, we have intensified our focus on developing foundation models that deliver exceptional utility and performance. Qwen3.5 represents a significant leap forward, integrating breakthroughs in multimodal learning, architectural efficiency, reinforcement learning scale, and global accessibility to empower developers and enterprises with unprecedented capability and efficiency.
+
+## Qwen3.5 Highlights
+
+Qwen3.5 features the following enhancement:
+
+- **Unified Vision-Language Foundation**: Early fusion training on multimodal tokens achieves cross-generational parity with Qwen3 and outperforms Qwen3-VL models across reasoning, coding, agents, and visual understanding benchmarks.
+
+- **Efficient Hybrid Architecture**: Gated Delta Networks combined with sparse Mixture-of-Experts deliver high-throughput inference with minimal latency and cost overhead.
+
+- **Scalable RL Generalization**: Reinforcement learning scaled across million-agent environments with progressively complex task distributions for robust real-world adaptability.
+
+- **Global Linguistic Coverage**: Expanded support to 201 languages and dialects, enabling inclusive, worldwide deployment with nuanced cultural and regional understanding.
+
+- **Next-Generation Training Infrastructure**: Near-100% multimodal training efficiency compared to text-only training and asynchronous RL frameworks supporting massive-scale agent scaffolds and environment orchestration.
+
+For more details, please refer to our blog post [Qwen3.5](https://qwen.ai/blog?id=qwen3.5).
+
+
+## Model Overview
+
+- Type: Causal Language Model with Vision Encoder
+- Training Stage: Pre-training & Post-training
+- Language Model
+ - Number of Parameters: 2B
+ - Hidden Dimension: 2048
+ - Token Embedding: 248320 (Padded)
+ - Number of Layers: 24
+ - Hidden Layout: 6 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))
+ - Gated DeltaNet:
+ - Number of Linear Attention Heads: 16 for V and 16 for QK
+ - Head Dimension: 128
+ - Gated Attention:
+ - Number of Attention Heads: 8 for Q and 2 for KV
+ - Head Dimension: 256
+ - Rotary Position Embedding Dimension: 64
+ - Feed Forward Network:
+ - Intermediate Dimension: 6144
+ - LM Output: 248320 (Tied to token embedding)
+ - MTP: trained with multi-steps
+- Context Length: 262,144 natively
+
+## Benchmark Results
+
+### Language
+
+
+
+
+Qwen3-4B-2507 Qwen3-1.7B Qwen3.5-2B Qwen3.5-0.8B
+
+Instruct (Non-Thinking) Mode
+
+MMLU-Pro
+69.6
+40.2
+55.3
+29.7
+
+
+MMLU-Redux
+84.2
+64.4
+69.2
+48.5
+
+
+C-Eval
+80.2
+61.0
+65.2
+46.4
+
+
+SuperGPQA
+42.8
+21.0
+30.4
+16.9
+
+
+IFEval
+83.4
+68.2
+61.2
+52.1
+
+
+MMMLU
+64.9
+46.7
+56.9
+34.1
+
+Knowledge & STEM (Thinking)
+
+MMLU-Pro
+74.0
+56.5
+66.5
+42.3
+
+
+MMLU-Redux
+86.1
+73.9
+79.6
+59.5
+
+
+C-Eval
+82.2
+68.1
+73.2
+50.5
+
+
+SuperGPQA
+47.8
+31.2
+37.5
+21.3
+
+
+GPQA
+65.8
+40.1
+51.6
+11.9
+
+Instruction Following (Thinking)
+
+IFEval
+87.4
+72.5
+78.6
+44.0
+
+
+IFBench
+50.4
+26.7
+41.3
+21.0
+
+
+MultiChallenge
+41.7
+27.2
+33.7
+18.9
+
+Long Context (Thinking)
+
+AA-LCR
+32.0
+6.7
+25.6
+4.7
+
+
+LongBench v2
+42.8
+26.5
+38.7
+26.1
+
+Reasoning (Thinking)
+
+HMMT Feb 25
+57.5
+10.2
+22.9
+--
+
+
+HMMT Nov 25
+69.6
+8.9
+19.6
+--
+
+General Agent (Thinking)
+
+BFCL-V4
+39.9
+--
+43.6
+25.3
+
+
+TAU2-Bench
+43.2
+--
+48.8
+11.6
+
+Multilingualism (Thinking)
+
+MMMLU
+70.8
+57.0
+63.1
+44.3
+
+
+MMLU-ProX
+62.4
+49.4
+52.3
+34.6
+
+
+NOVA-63
+47.1
+40.3
+46.4
+42.4
+
+
+INCLUDE
+64.4
+51.8
+55.4
+40.6
+
+
+Global PIQA
+73.5
+63.1
+69.3
+59.4
+
+
+PolyMATH
+46.2
+25.2
+26.1
+8.2
+
+
+WMT24++
+58.9
+39.3
+45.8
+27.2
+
+
+MAXIFE
+72.1
+50.7
+60.6
+39.2
+
+
+
+
+* TAU2-Bench: we follow the official setup except for the airline domain, where all models are evaluated by applying the fixes proposed in the Claude Opus 4.5 system card.
+
+* MMLU-ProX: we report the averaged accuracy on 29 languages.
+* WMT24++: a harder subset of WMT24 after difficulty labeling and rebalancing; we report the averaged scores on 55 languages using XCOMET-XXL.
+* MAXIFE: we report the accuracy on English + multilingual original prompts (totally 23 settings).
+* Experimental settings: top_p=0.95, top_k=20, presence_penalty=1.5, and temperature=1.0 were used.
+* Empty cells (--) indicate scores not yet available or not applicable.
+
+
+
+### Vision Language
+
+
+
+
+Qwen3-VL-4B Qwen3-VL-2B Qwen3.5-2B Qwen3.5-0.8B
+
+STEM and Puzzle
+
+MMMU
+70.8
+61.4
+64.2/64.2
+49/47.4
+
+
+MMMU-Pro
+57.0
+42.5
+50.3/47.7
+31.2/31.4
+
+
+Mathvista(mini)
+79.5
+73.6
+76.7/73.9
+62.2/58.6
+
+
+DynaMath
+74.4
+66.7
+73.6/69.6
+49.9/46.5
+
+
+ZEROBench
+0.0
+0.0
+1/0
+0/0
+
+
+ZEROBench_sub
+18.9
+13.2
+17.1/18.6
+12.9/11.4
+
+
+VlmsAreBlind
+68.6
+50.0
+75.8/74.3
+59.4/57.3
+
+General VQA
+
+RealWorldQA
+73.2
+69.5
+74.5/71.2
+63.4/61.6
+
+
+MMStar
+73.2
+68.1
+71.7/68.0
+58.3/55.9
+
+
+MMBenchEN-DEV-v1.1
+86.7
+81.9
+83.3/81.3
+69.9/68.0
+
+
+SimpleVQA
+48.8
+43.6
+38.5/39.5
+31.3/30.4
+
+
+HallusionBench
+64.1
+54.9
+58.0/51.3
+53.1/46.7
+
+Text Recognition and Document Understanding
+
+MMLongBench-Doc
+44.4
+33.8
+45.4/38.8
+33.6/28.1
+
+
+AI2D_TEST
+84.9
+80.4
+83.3/81.5
+69.9/68.7
+
+
+CC-OCR
+73.8
+68.3
+72.9/75.8
+63.2/66.7
+
+
+OmniDocBench1.5
+80.0
+65.9
+79.8/80.9
+61.0/70.6
+
+
+CharXiv(RQ)
+50.3
+37.1
+58.8/52.6
+41.3/38.2
+
+
+OCRBench
+80.8
+79.2
+84.5/85.4
+74.5/79.1
+
+Spatial Intelligence
+
+RefCOCO(avg)
+88.2
+84.8
+84.8/84.3
+79.3/77.8
+
+
+CountBench
+89.4
+84.1
+91.4/86.8
+77.0/68.6
+
+
+ODInW13
+39.4
+36.0
+35.9/40.5
+31.6/33.2
+
+
+ERQA
+47.3
+41.8
+43.8/33.0
+34.5/23.8
+
+
+EmbSpatialBench
+80.7
+75.9
+77.9/66.4
+68.6/54.6
+
+
+RefSpatialBench
+45.3
+28.9
+32.9/30.0
+23.5/21.7
+
+
+Hypersim
+11.9
+11.2
+12.4/12.4
+11.9/11.0
+
+
+SUNRGBD
+28.0
+28.6
+28.7/25.6
+26.1/23.3
+
+
+Nuscene
+4.9
+4.0
+6.9/8.5
+5.7/7.0
+
+Video Understanding
+
+VideoMME(w sub.)
+76.0
+67.9
+75.6/--
+63.8/--
+
+
+VideoMME(w/o sub.)
+68.9
+62.1
+69.0/--
+57.7/--
+
+
+VideoMMMU
+69.4
+54.1
+62.1/--
+44.3/--
+
+
+MLVU
+75.7
+69.2
+76.2/--
+65.6/--
+
+
+MVBench
+69.3
+64.5
+64.9/--
+55.8/--
+
+
+LVBench
+53.5
+47.6
+57.1/--
+45.1/--
+
+
+MMVU
+58.6
+48.9
+48.6/--
+34.3/--
+
+Visual Agent
+
+ScreenSpot Pro
+59.5
+48.5
+--/54.5
+--/46.5
+
+Medical VQA
+
+SLAKE
+65.9
+61.1
+74.4/67.5
+62.6/59.5
+
+
+PMC-VQA
+48.4
+42.4
+48.8/54.0
+40.4/45.5
+
+
+MedXpertQA-MM
+26.3
+13.0
+26.9/19.1
+17.1/25.3
+
+
+
+
+
+* Scores of Qwen3.5 models are reported as Thinking / Non-thinking.
+* MathVision: our model’s score is evaluated using a fixed prompt, e.g., “Please reason step by step, and put your final answer within \boxed{}.” For other models, we report the higher score between runs with and without the \boxed{} formatting.
+* Experimental settings: For the Video benchmarks, we used top_p=0.95, top_k=20, presence_penalty=1.5, and temperature=1.0. All other benchmarks adopted the same hyperparameter configuration but with temperature=0.6 under the thinking mode. Under the no-thinking mode, the inference hyperparameters were set to top_p=0.8, top_k=20, presence_penalty=1.5, and temperature=0.7.
+* Empty cells (--) indicate scores not yet available or not applicable.
+
+
+
+## Quickstart
+
+> [!Important]
+> Qwen3.5 models support both non-thinking and thinking mode. **Qwen3.5-2B operates in non-thinking mode by default**.
+> To enable thinking, refer to the examples [here](#thinking-mode).
+
+For streamlined integration, we recommend using Qwen3.5 via APIs. Below is a guide to use Qwen3.5 via OpenAI-compatible API.
+
+### Serving Qwen3.5
+
+Qwen3.5 can be served via APIs with popular inference frameworks.
+In the following, we show example commands to launch OpenAI-Compatible API servers for Qwen3.5 models.
+
+> [!Important]
+> Inference efficiency and throughput vary significantly across frameworks.
+> We recommend using the latest framework versions to ensure optimal performance and compatibility.
+> For production workloads or high-throughput scenarios, dedicated serving engines such as SGLang, KTransformers or vLLM are strongly recommended.
+
+> [!Important]
+> The model has a default context length of 262,144 tokens.
+> If you encounter out-of-memory (OOM) errors, consider reducing the context window.
+
+#### SGLang
+
+[SGLang](https://github.com/sgl-project/sglang) is a fast serving framework for large language models and vision language models.
+SGLang from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment:
+```shell
+uv pip install 'git+https://github.com/sgl-project/sglang.git#subdirectory=python&egg=sglang[all]'
+```
+See [its documentation](https://docs.sglang.ai/get_started/install.html) for more details.
+
+The following will create API endpoints at `http://localhost:8000/v1`:
+
+- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs.
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.5-2B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144
+ ```
+
+- **Tool Use**: To support tool use, you can use the following command.
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.5-2B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --tool-call-parser qwen3_coder
+ ```
+
+- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP:
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.5-2B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --speculative-algo NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4
+ ```
+
+#### vLLM
+
+[vLLM](https://github.com/vllm-project/vllm) is a high-throughput and memory-efficient inference and serving engine for LLMs.
+vLLM from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment:
+```shell
+uv pip install vllm --torch-backend=auto --extra-index-url https://wheels.vllm.ai/nightly
+```
+See [its documentation](https://docs.vllm.ai/en/stable/getting_started/installation/index.html) for more details.
+
+For detailed Qwen3.5 usage guide, see the [vLLM Qwen3.5 recipe](https://docs.vllm.ai/projects/recipes/en/latest/Qwen/Qwen3.5.html).
+
+The following will create API endpoints at `http://localhost:8000/v1`:
+
+- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs.
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-2B --port 8000 --tensor-parallel-size 1 --max-model-len 262144
+ ```
+
+- **Tool Call**: To support tool use, you can use the following command.
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-2B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --enable-auto-tool-choice --tool-call-parser qwen3_coder
+ ```
+
+- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP:
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-2B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}'
+ ```
+
+- **Text-Only**: The following command skips the vision encoder and multimodal profiling to free up memory for additional KV cache:
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-2B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --language-model-only
+ ```
+
+#### KTransformers
+
+[KTransformers](https://github.com/kvcache-ai/ktransformers) is a flexible framework for experiencing cutting-edge LLM inference optimizations with CPU-GPU heterogeneous computing.
+For running Qwen3.5 with KTransformers, see the [KTransformers Deployment Guide](https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/Qwen3.5.md).
+
+#### Hugging Face Transformers
+
+Hugging Face Transformers contains a _lightweight_ server which can be used for quick testing and moderate load deployment.
+The latest `transformers` is required for Qwen3.5:
+```shell
+pip install "transformers[serving] @ git+https://github.com/huggingface/transformers.git@main"
+```
+See [its documentation](https://huggingface.co/docs/transformers/main/serving) for more details. Please also make sure torchvision and pillow are installed.
+
+Then, run `transformers serve` to launch a server with API endpoints at `http://localhost:8000/v1`; it will place the model on accelerators if available:
+```shell
+transformers serve --force-model Qwen/Qwen3.5-2B --port 8000 --continuous-batching
+```
+
+### Using Qwen3.5 via the Chat Completions API
+
+The chat completions API is accessible via standard HTTP requests or OpenAI SDKs.
+Here, we show examples using the OpenAI Python SDK.
+
+Before starting, make sure it is installed and the API key and the API base URL is configured, e.g.:
+```shell
+pip install -U openai
+
+# Set the following accordingly
+export OPENAI_BASE_URL="http://localhost:8000/v1"
+export OPENAI_API_KEY="EMPTY"
+```
+
+> [!Tip]
+> We recommend using the following set of sampling parameters for generation
+> - Non-thinking mode for text tasks: `temperature=1.0, top_p=1.00, top_k=20, min_p=0.0, presence_penalty=2.0, repetition_penalty=1.0`
+> - Non-thinking mode for VL tasks: `temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0`
+> - Thinking mode for text tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0`
+> - Thinking mode for VL or precise coding (e.g. WebDev) tasks : `temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0`
+>
+> Please note that the support for sampling parameters varies according to inference frameworks.
+
+#### Text-Only Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {"role": "user", "content": "Give me a short introduction to large language models."},
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-2B",
+ messages=messages,
+ max_tokens=32768,
+ temperature=1.0,
+ top_p=1.0,
+ presence_penalty=2.0,
+ extra_body={
+ "top_k": 20,
+ },
+)
+print("Chat response:", chat_response)
+```
+
+#### Image Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {
+ "type": "image_url",
+ "image_url": {
+ "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/RealWorld/RealWorld-04.png"
+ }
+ },
+ {
+ "type": "text",
+ "text": "Where is this?"
+ }
+ ]
+ }
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-2B",
+ messages=messages,
+ max_tokens=32768,
+ temperature=0.7,
+ top_p=0.8,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ },
+)
+print("Chat response:", chat_response)
+```
+
+#### Video Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {
+ "type": "video_url",
+ "video_url": {
+ "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4"
+ }
+ },
+ {
+ "type": "text",
+ "text": "Summarize the video content."
+ }
+ ]
+ }
+]
+
+# When vLLM is launched with `--media-io-kwargs '{"video": {"num_frames": -1}}'`,
+# video frame sampling can be configured via `extra_body` (e.g., by setting `fps`).
+# This feature is currently supported only in vLLM.
+#
+# By default, `fps=2` and `do_sample_frames=True`.
+# With `do_sample_frames=True`, you can customize the `fps` value to set your desired video sampling rate.
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-2B",
+ messages=messages,
+ max_tokens=32768,
+ temperature=0.7,
+ top_p=0.8,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True},
+ },
+)
+
+print("Chat response:", chat_response)
+```
+
+#### Thinking Mode
+
+> [!Important]
+> Qwen3.5 does not officially support the soft switch of Qwen3, i.e., `/think` and `/nothink`.
+
+You can make the model think before response by configuring the API parameters.
+For example,
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {"role": "user", "content": "Type \"I love Qwen3.5\" backwards"},
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-2B",
+ messages=messages,
+ max_tokens=81920,
+ temperature=1.0,
+ top_p=0.95,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ "enable_thinking": True,
+ },
+)
+print("Chat response:", chat_response)
+```
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {
+ "type": "image_url",
+ "image_url": {
+ "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg"
+ }
+ },
+ {
+ "type": "text",
+ "text": "The centres of the four illustrated circles are in the corners of the square. The two big circles touch each other and also the two little circles. With which factor do you have to multiply the radii of the little circles to obtain the radius of the big circles?\nChoices:\n(A) $\\frac{2}{9}$\n(B) $\\sqrt{5}$\n(C) $0.8 \\cdot \\pi$\n(D) 2.5\n(E) $1+\\sqrt{2}$"
+ }
+ ]
+ }
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-2B",
+ messages=messages,
+ max_tokens=81920,
+ temperature=1.0,
+ top_p=0.95,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ },
+)
+print("Chat response:", chat_response)
+```
+
+> [!Important]
+> In thinking mode, we have observed that when using the recommended sampling parameters, Qwen3.5-2B is more prone to entering thinking loops compared to other Qwen3.5 models, which may prevent it from terminating generation properly.
+> We recommend further tuning the sampling parameters specific to your use case and utilizing the API's streaming generation mode (if supported) to enable timely detection and interruption of such anomalous generation behaviors.
+
+
+## Agentic Usage
+
+Qwen3.5 excels in tool calling capabilities.
+
+### Qwen-Agent
+
+We recommend using [Qwen-Agent](https://github.com/QwenLM/Qwen-Agent) to quickly build Agent applications with Qwen3.5.
+
+To define the available tools, you can use the MCP configuration file, use the integrated tool of Qwen-Agent, or integrate other tools by yourself.
+```python
+import os
+from qwen_agent.agents import Assistant
+
+# Define LLM
+# Using OpenAI-compatible API endpoint. The API backend should disable response parsers.
+llm_cfg = {
+ # Use your own model service compatible with OpenAI API by vLLM/SGLang:
+ 'model': 'Qwen/Qwen3.5-2B',
+ 'model_type': 'qwenvl_oai',
+ 'model_server': 'http://localhost:8000/v1', # api_base
+ 'api_key': 'EMPTY',
+
+ 'generate_cfg': {
+ 'use_raw_api': True,
+ # Pass the parameter of whether to enable thinking mode in this way
+ # 'extra_body': {
+ # 'chat_template_kwargs': {'enable_thinking': True}
+ # },
+ },
+}
+
+# Define Tools
+tools = [
+ {'mcpServers': { # You can specify the MCP configuration file
+ "filesystem": {
+ "command": "npx",
+ "args": ["-y", "@modelcontextprotocol/server-filesystem", "/Users/xxxx/Desktop"]
+ }
+ }
+ }
+]
+
+# Define Agent
+bot = Assistant(llm=llm_cfg, function_list=tools)
+
+# Streaming generation
+messages = [{'role': 'user', 'content': 'Help me organize my desktop.'}]
+for responses in bot.run(messages=messages):
+ pass
+print(responses)
+
+# Streaming generation
+messages = [{'role': 'user', 'content': 'Develop a dog website and save it on the desktop'}]
+for responses in bot.run(messages=messages):
+ pass
+print(responses)
+```
+
+### Qwen Code
+
+
+[Qwen Code](https://github.com/QwenLM/qwen-code) is an open-source AI agent for the terminal, optimized for Qwen models. It helps you understand large codebases, automate tedious work, and ship faster.
+
+For more information, please refer to [Qwen Code](https://qwenlm.github.io/qwen-code-docs/).
+
+## Best Practices
+
+To achieve optimal performance, we recommend the following settings:
+
+1. **Sampling Parameters**:
+ - We suggest using the following sets of sampling parameters depending on the mode and task type:
+ - **Non-thinking mode for text tasks**:
+ `temperature=1.0`, `top_p=1.00`, `top_k=20`, `min_p=0.0`, `presence_penalty=2.0`, `repetition_penalty=1.0`
+ - **Non-thinking mode for VL tasks**:
+ `temperature=0.7`, `top_p=0.80`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0`
+ - **Thinking mode for text tasks**:
+ `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0`
+ - **Thinking mode for VL or precise coding (e.g., WebDev) tasks**:
+ `temperature=0.6`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0`
+
+ - For supported frameworks, you can adjust the `presence_penalty` parameter between 0 and 2 to reduce endless repetitions. However, using a higher value may occasionally result in language mixing and a slight decrease in model performance.
+
+2. **Adequate Output Length**: We recommend using an output length of 32,768 tokens for most queries. For benchmarking on highly complex problems, such as those found in math and programming competitions, we suggest setting the max output length to 81,920 tokens. This provides the model with sufficient space to generate detailed and comprehensive responses, thereby enhancing its overall performance.
+
+3. **Standardize Output Format**: We recommend using prompts to standardize model outputs when benchmarking.
+ - **Math Problems**: Include "Please reason step by step, and put your final answer within \boxed{}." in the prompt.
+ - **Multiple-Choice Questions**: Add the following JSON structure to the prompt to standardize responses: "Please show your choice in the `answer` field with only the choice letter, e.g., `"answer": "C"`."
+
+4. **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final output part and does not need to include the thinking content. It is implemented in the provided chat template in Jinja2. However, for frameworks that do not directly use the Jinja2 chat template, it is up to the developers to ensure that the best practice is followed.
+
+5. **Long Video Understanding**: To optimize inference efficiency for plain text and images, the `size` parameter in the released `video_preprocessor_config.json` is conservatively configured. It is recommended to set the `longest_edge` parameter in the video_preprocessor_config file to 469,762,048 (corresponding to 224k video tokens) to enable higher frame-rate sampling for hour-scale videos and thereby achieve superior performance. For example,
+ ```json
+ {"longest_edge": 469762048, "shortest_edge": 4096}
+ ```
+
+ Alternatively, override the default values via engine startup parameters. For implementation details, refer to: [vLLM](https://github.com/vllm-project/vllm/pull/34330) / [SGLang](https://github.com/sgl-project/sglang/pull/18467).
+
+
+### Citation
+
+If you find our work helpful, feel free to give us a cite.
+
+```bibtex
+@misc{qwen3.5,
+ title = {{Qwen3.5}: Towards Native Multimodal Agents},
+ author = {{Qwen Team}},
+ month = {February},
+ year = {2026},
+ url = {https://qwen.ai/blog?id=qwen3.5}
+}
+```
\ No newline at end of file
diff --git a/chat/gguf/unsloth/Qwen3.5-2B-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/Qwen3.5-2B-GGUF/mmproj-F16.gguf
new file mode 100644
index 0000000..5c87505
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.5-2B-GGUF/mmproj-F16.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:7035e9cb8d7c6a9681d07eef9a364783e86ea4cd73faab2eabb4f43a101830c7
+size 668227264
diff --git a/chat/gguf/unsloth/Qwen3.5-4B-GGUF/Qwen3.5-4B-Q4_K_M.gguf b/chat/gguf/unsloth/Qwen3.5-4B-GGUF/Qwen3.5-4B-Q4_K_M.gguf
new file mode 100644
index 0000000..4ca59aa
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.5-4B-GGUF/Qwen3.5-4B-Q4_K_M.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:00fe7986ff5f6b463e62455821146049db6f9313603938a70800d1fb69ef11a4
+size 2740937888
diff --git a/chat/gguf/unsloth/Qwen3.5-4B-GGUF/README.md b/chat/gguf/unsloth/Qwen3.5-4B-GGUF/README.md
new file mode 100644
index 0000000..265d2de
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.5-4B-GGUF/README.md
@@ -0,0 +1,1201 @@
+---
+tags:
+- unsloth
+library_name: transformers
+license: apache-2.0
+license_link: https://huggingface.co/Qwen/Qwen3.5-4B/blob/main/LICENSE
+pipeline_tag: image-text-to-text
+base_model:
+- Qwen/Qwen3.5-4B
+---
+
+
+
+
+
+ Unsloth Dynamic 2.0 achieves superior accuracy & outperforms other leading quants.
+
+
+
+
+- You can now also fine-tune the model locally with [Unsloth](https://github.com/unslothai/unsloth).
+- Read our [Qwen3.5 fine-tuning guide here](https://unsloth.ai/docs/models/qwen3.5/fine-tune).
+
+---
+
+# Qwen3.5-4B
+
+
+
+[](https://chat.qwen.ai)
+
+> [!Note]
+> This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format.
+>
+> These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, KTransformers, etc.
+
+Over recent months, we have intensified our focus on developing foundation models that deliver exceptional utility and performance. Qwen3.5 represents a significant leap forward, integrating breakthroughs in multimodal learning, architectural efficiency, reinforcement learning scale, and global accessibility to empower developers and enterprises with unprecedented capability and efficiency.
+
+## Qwen3.5 Highlights
+
+Qwen3.5 features the following enhancement:
+
+- **Unified Vision-Language Foundation**: Early fusion training on multimodal tokens achieves cross-generational parity with Qwen3 and outperforms Qwen3-VL models across reasoning, coding, agents, and visual understanding benchmarks.
+
+- **Efficient Hybrid Architecture**: Gated Delta Networks combined with sparse Mixture-of-Experts deliver high-throughput inference with minimal latency and cost overhead.
+
+- **Scalable RL Generalization**: Reinforcement learning scaled across million-agent environments with progressively complex task distributions for robust real-world adaptability.
+
+- **Global Linguistic Coverage**: Expanded support to 201 languages and dialects, enabling inclusive, worldwide deployment with nuanced cultural and regional understanding.
+
+- **Next-Generation Training Infrastructure**: Near-100% multimodal training efficiency compared to text-only training and asynchronous RL frameworks supporting massive-scale agent scaffolds and environment orchestration.
+
+
+
+
+For more details, please refer to our blog post [Qwen3.5](https://qwen.ai/blog?id=qwen3.5).
+
+
+## Model Overview
+
+- Type: Causal Language Model with Vision Encoder
+- Training Stage: Pre-training & Post-training
+- Language Model
+ - Number of Parameters: 4B
+ - Hidden Dimension: 2560
+ - Token Embedding: 248320 (Padded)
+ - Number of Layers: 32
+ - Hidden Layout: 8 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))
+ - Gated DeltaNet:
+ - Number of Linear Attention Heads: 32 for V and 16 for QK
+ - Head Dimension: 128
+ - Gated Attention:
+ - Number of Attention Heads: 16 for Q and 4 for KV
+ - Head Dimension: 256
+ - Rotary Position Embedding Dimension: 64
+ - Feed Forward Network:
+ - Intermediate Dimension: 9216
+ - LM Output: 248320 (Tied to token embedding)
+ - MTP: trained with multi-steps
+- Context Length: 262,144 natively and extensible up to 1,010,000 tokens.
+
+## Benchmark Results
+
+### Language
+
+
+
+
+GPT-OSS-120B GPT-OSS-20B Qwen3-Next-80B-A3B-Thinking Qwen3-30BA3B-Thinking-2507 Qwen3.5-9B Qwen3.5-4B
+
+Knowledge & STEM
+
+MMLU-Pro
+80.8
+74.8
+82.7
+80.9
+82.5
+79.1
+
+
+MMLU-Redux
+91.0
+87.8
+92.5
+91.4
+91.1
+88.8
+
+
+C-Eval
+76.2
+71.4
+89.7
+87.4
+88.2
+85.1
+
+
+SuperGPQA
+54.6
+48.5
+60.8
+56.8
+58.2
+52.9
+
+
+GPQA Diamond
+80.1
+71.5
+77.2
+73.4
+81.7
+76.2
+
+Instruction Following
+
+IFEval
+88.9
+88.2
+88.9
+88.9
+91.5
+89.8
+
+
+IFBench
+69.0
+65.1
+61.5
+51.5
+64.5
+59.2
+
+
+MultiChallenge
+45.3
+40.1
+51.3
+46.5
+54.5
+49.0
+
+Long Context
+
+AA-LCR
+50.7
+30.7
+51.7
+49.0
+63.0
+57.0
+
+
+LongBench v2
+48.2
+45.6
+48.0
+44.8
+55.2
+50.0
+
+Reasoning & Coding
+
+HMMT Feb 25
+90.0
+76.7
+73.7
+63.1
+83.2
+74.0
+
+
+HMMT Nov 25
+90.0
+81.8
+81.2
+73.8
+82.9
+76.8
+
+
+LiveCodeBench v6
+82.7
+74.6
+68.7
+66.0
+65.6
+55.8
+
+
+OJBench
+41.5
+36.3
+29.7
+25.1
+29.2
+24.1
+
+General Agent
+
+BFCL-V4
+--
+--
+49.7
+42.4
+66.1
+50.3
+
+
+TAU2-Bench
+--
+--
+57.4
+41.9
+79.1
+79.9
+
+
+VITA-Bench
+--
+--
+29.5
+14.1
+29.8
+22.0
+
+
+DeepPlanning
+--
+--
+0.4
+4.9
+18.0
+17.6
+
+Multilingualism
+
+MMMLU
+78.2
+69.7
+81.3
+78.4
+81.2
+76.1
+
+
+MMLU-ProX
+74.5
+67.3
+73.6
+69.1
+76.3
+71.5
+
+
+NOVA-63
+51.1
+48.7
+53.3
+52.5
+55.9
+54.3
+
+
+INCLUDE
+74.0
+65.3
+78.3
+74.4
+75.6
+71.0
+
+
+Global PIQA
+84.1
+79.8
+83.5
+80.2
+83.2
+78.9
+
+
+PolyMATH
+54.0
+30.9
+62.4
+52.6
+57.3
+51.1
+
+
+WMT24++
+74.4
+67.8
+57.4
+69.3
+72.6
+66.6
+
+
+MAXIFE
+83.7
+80.1
+79.9
+77.4
+83.4
+78.0
+
+
+
+
+* TAU2-Bench: we follow the official setup except for the airline domain, where all models are evaluated by applying the fixes proposed in the Claude Opus 4.5 system card.
+
+* MMLU-ProX: we report the averaged accuracy on 29 languages.
+* WMT24++: a harder subset of WMT24 after difficulty labeling and rebalancing; we report the averaged scores on 55 languages using XCOMET-XXL.
+* MAXIFE: we report the accuracy on English + multilingual original prompts (totally 23 settings).
+* Empty cells (--) indicate scores not yet available or not applicable.
+
+
+
+
+### Vision Language
+
+
+
+
+GPT-5-Nano-2025-08-07 Gemini-2.5-Flash-Lite Qwen3-VL-30B-A3B Qwen3.5-9B Qwen3.5-4B
+
+STEM and Puzzle
+
+MMMU
+75.8
+73.4
+76.0
+78.4
+77.6
+
+
+MMMU-Pro
+57.2
+59.7
+63.0
+70.1
+66.3
+
+
+MathVision
+62.2
+52.1
+65.7
+78.9
+74.6
+
+
+Mathvista(mini)
+71.5
+72.8
+81.9
+85.7
+85.1
+
+
+We-Math
+62.5
+32.1
+70.0
+75.2
+75.4
+
+
+DynaMath
+78.0
+69.9
+80.1
+83.6
+83.3
+
+
+ZEROBench
+1.0
+1.0
+0.0
+3.0
+3.0
+
+
+ZEROBench_sub
+22.2
+19.2
+23.7
+31.1
+26.3
+
+
+VlmsAreBlind
+66.7
+68.4
+72.5
+93.7
+92.6
+
+
+BabyVision
+14.4
+17.5
+18.6
+28.6/25.8
+16.0/19.1
+
+General VQA
+
+RealWorldQA
+71.8
+72.2
+77.4
+80.3
+79.5
+
+
+MMStar
+68.6
+69.1
+75.5
+79.7
+78.3
+
+
+MMBenchEN-DEV-v1.1
+80.3
+82.7
+88.9
+90.1
+89.4
+
+
+SimpleVQA
+46.0
+54.1
+54.3
+51.2
+43.4
+
+
+HallusionBench
+58.4
+64.5
+66.0
+69.3
+65.0
+
+Text Recognition and Document Understanding
+
+OmniDocBench1.5
+55.9
+79.4
+86.8
+87.7
+86.2
+
+
+CharXiv(RQ)
+50.1
+56.1
+56.6
+73.0
+70.8
+
+
+MMLongBench-Doc
+31.8
+46.5
+47.4
+57.7
+54.2
+
+
+CC-OCR
+58.9
+72.9
+77.8
+79.3
+76.7
+
+
+AI2D_TEST
+81.9
+85.7
+86.9
+90.2
+89.6
+
+
+OCRBench
+75.3
+82.5
+83.9
+89.2
+85.0
+
+Spatial Intelligence
+
+ERQA
+45.8
+44.3
+45.3
+55.5
+54.0
+
+
+CountBench
+80.0
+79.2
+90.0
+97.2
+96.3
+
+
+RefCOCO(avg)
+--
+--
+89.3
+89.7
+88.1
+
+
+EmbSpatialBench
+74.2
+66.1
+80.6
+83.0
+81.3
+
+
+RefSpatialBench
+12.6
+11.2
+54.2
+58.5
+54.6
+
+
+LingoQA
+57.0
+17.8
+62.0
+80.4
+74.4
+
+
+Hypersim
+--
+--
+11.4
+13.5
+12.5
+
+
+Nuscene
+--
+--
+10.3
+11.8
+9.9
+
+Video Understanding
+
+VideoMME(w sub.)
+71.7
+74.6
+79.9
+84.5
+83.5
+
+
+VideoMME(w/o sub.)
+66.2
+72.7
+73.3
+78.4
+76.9
+
+
+VideoMMMU
+63.0
+69.2
+75.0
+78.9
+74.1
+
+
+MLVU
+69.2
+78.5
+78.9
+84.4
+82.8
+
+
+MVBench
+--
+--
+72.0
+74.4
+71.2
+
+
+LVBench
+--
+60.9
+59.2
+70.0
+66.4
+
+
+MMVU
+63.1
+65.3
+66.1
+67.8
+64.9
+
+Visual Agent
+
+ScreenSpot Pro
+--
+--
+60.5
+65.2
+60.3
+
+
+OSWorld-Verified
+--
+--
+30.6
+41.8
+35.6
+
+
+AndroidWorld
+--
+--
+55.0
+57.8
+58.6
+
+Tool Calling
+
+TIR-Bench
+18.5
+21.5
+22.5
+45.6/31.9
+38.9/29.9
+
+
+V*
+68.1
+69.6
+83.2
+90.1/88.5
+84.3/86.4
+
+Medical VQA
+
+SLAKE
+57.0
+65.0
+68.8
+79.0
+76.1
+
+
+PMC-VQA
+37.8
+48.8
+51.5
+57.9
+55.5
+
+
+MedXpertQA-MM
+26.7
+35.3
+35.5
+49.9
+42.9
+
+
+
+
+
+* MathVision: our model’s score is evaluated using a fixed prompt, e.g., “Please reason step by step, and put your final answer within \boxed{}.” For other models, we report the higher score between runs with and without the \boxed{} formatting.
+* BabyVision: scores reported as "with CI / without CI".
+* TIR-Bench and V*: scores reported as "with CI / without CI".
+* Empty cells (--) indicate scores not yet available or not applicable.
+
+
+
+
+
+
+## Quickstart
+
+> [!Important]
+> Qwen3.5 models operate in thinking mode by default, generating thinking content signified by `\n... \n\n` before producing the final responses.
+> To disable thinking content and obtain direct response, refer to the examples [here](#instruct-or-non-thinking-mode).
+
+
+For streamlined integration, we recommend using Qwen3.5 via APIs. Below is a guide to use Qwen3.5 via OpenAI-compatible API.
+
+### Serving Qwen3.5
+
+Qwen3.5 can be served via APIs with popular inference frameworks.
+In the following, we show example commands to launch OpenAI-Compatible API servers for Qwen3.5 models.
+
+
+> [!Important]
+> Inference efficiency and throughput vary significantly across frameworks.
+> We recommend using the latest framework versions to ensure optimal performance and compatibility.
+> For production workloads or high-throughput scenarios, dedicated serving engines such as SGLang, KTransformers or vLLM are strongly recommended.
+
+> [!Important]
+> The model has a default context length of 262,144 tokens.
+> If you encounter out-of-memory (OOM) errors, consider reducing the context window.
+> However, because Qwen3.5 leverages extended context for complex tasks, we advise maintaining a context length of at least 128K tokens to preserve thinking capabilities.
+
+#### SGLang
+
+[SGLang](https://github.com/sgl-project/sglang) is a fast serving framework for large language models and vision language models.
+SGLang from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment:
+```shell
+uv pip install 'git+https://github.com/sgl-project/sglang.git#subdirectory=python&egg=sglang[all]'
+```
+See [its documentation](https://docs.sglang.ai/get_started/install.html) for more details.
+
+The following will create API endpoints at `http://localhost:8000/v1`:
+
+- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs.
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.5-4B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3
+ ```
+
+- **Tool Use**: To support tool use, you can use the following command.
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.5-4B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_coder
+ ```
+
+- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP:
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.5-4B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --speculative-algo NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4
+ ```
+
+#### vLLM
+
+[vLLM](https://github.com/vllm-project/vllm) is a high-throughput and memory-efficient inference and serving engine for LLMs.
+vLLM from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment:
+```shell
+uv pip install vllm --torch-backend=auto --extra-index-url https://wheels.vllm.ai/nightly
+```
+See [its documentation](https://docs.vllm.ai/en/stable/getting_started/installation/index.html) for more details.
+
+For detailed Qwen3.5 usage guide, see the [vLLM Qwen3.5 recipe](https://docs.vllm.ai/projects/recipes/en/latest/Qwen/Qwen3.5.html).
+
+The following will create API endpoints at `http://localhost:8000/v1`:
+
+- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs.
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-4B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3
+ ```
+
+- **Tool Call**: To support tool use, you can use the following command.
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-4B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
+ ```
+
+- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP:
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-4B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 --speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}'
+ ```
+
+- **Text-Only**: The following command skips the vision encoder and multimodal profiling to free up memory for additional KV cache:
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-4B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 --language-model-only
+ ```
+
+#### KTransformers
+
+[KTransformers](https://github.com/kvcache-ai/ktransformers) is a flexible framework for experiencing cutting-edge LLM inference optimizations with CPU-GPU heterogeneous computing.
+For running Qwen3.5 with KTransformers, see the [KTransformers Deployment Guide](https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/Qwen3.5.md).
+
+#### Hugging Face Transformers
+
+Hugging Face Transformers contains a _lightweight_ server which can be used for quick testing and moderate load deployment.
+The latest `transformers` is required for Qwen3.5:
+```shell
+pip install "transformers[serving] @ git+https://github.com/huggingface/transformers.git@main"
+```
+See [its documentation](https://huggingface.co/docs/transformers/main/serving) for more details. Please also make sure torchvision and pillow are installed.
+
+Then, run `transformers serve` to launch a server with API endpoints at `http://localhost:8000/v1`; it will place the model on accelerators if available:
+```shell
+transformers serve --force-model Qwen/Qwen3.5-4B --port 8000 --continuous-batching
+```
+
+### Using Qwen3.5 via the Chat Completions API
+
+The chat completions API is accessible via standard HTTP requests or OpenAI SDKs.
+Here, we show examples using the OpenAI Python SDK.
+
+Before starting, make sure it is installed and the API key and the API base URL is configured, e.g.:
+```shell
+pip install -U openai
+
+# Set the following accordingly
+export OPENAI_BASE_URL="http://localhost:8000/v1"
+export OPENAI_API_KEY="EMPTY"
+```
+
+> [!Tip]
+> We recommend using the following set of sampling parameters for generation
+> - Thinking mode for general tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0`
+> - Thinking mode for precise coding tasks (e.g. WebDev): `temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0`
+> - Instruct (or non-thinking) mode for general tasks: `temperature=0.7, top_p=0.8, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0`
+> - Instruct (or non-thinking) mode for reasoning tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0`
+>
+> Please note that the support for sampling parameters varies according to inference frameworks.
+
+#### Text-Only Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {"role": "user", "content": "Type \"I love Qwen3.5\" backwards"},
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-4B",
+ messages=messages,
+ max_tokens=81920,
+ temperature=1.0,
+ top_p=0.95,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ },
+)
+print("Chat response:", chat_response)
+```
+
+
+#### Image Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {
+ "type": "image_url",
+ "image_url": {
+ "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg"
+ }
+ },
+ {
+ "type": "text",
+ "text": "The centres of the four illustrated circles are in the corners of the square. The two big circles touch each other and also the two little circles. With which factor do you have to multiply the radii of the little circles to obtain the radius of the big circles?\nChoices:\n(A) $\\frac{2}{9}$\n(B) $\\sqrt{5}$\n(C) $0.8 \\cdot \\pi$\n(D) 2.5\n(E) $1+\\sqrt{2}$"
+ }
+ ]
+ }
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-4B",
+ messages=messages,
+ max_tokens=81920,
+ temperature=1.0,
+ top_p=0.95,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ },
+)
+print("Chat response:", chat_response)
+```
+
+#### Video Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {
+ "type": "video_url",
+ "video_url": {
+ "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4"
+ }
+ },
+ {
+ "type": "text",
+ "text": "Summarize the video content."
+ }
+ ]
+ }
+]
+
+# When vLLM is launched with `--media-io-kwargs '{"video": {"num_frames": -1}}'`,
+# video frame sampling can be configured via `extra_body` (e.g., by setting `fps`).
+# This feature is currently supported only in vLLM.
+#
+# By default, `fps=2` and `do_sample_frames=True`.
+# With `do_sample_frames=True`, you can customize the `fps` value to set your desired video sampling rate.
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-4B",
+ messages=messages,
+ max_tokens=81920,
+ temperature=1.0,
+ top_p=0.95,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True},
+ },
+)
+
+print("Chat response:", chat_response)
+```
+
+#### Instruct (or Non-Thinking) Mode
+
+> [!Important]
+> Qwen3.5 does not officially support the soft switch of Qwen3, i.e., `/think` and `/nothink`.
+
+Qwen3.5 will think by default before response.
+You can obtain direct response from the model without thinking by configuring the API parameters.
+For example,
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {
+ "type": "image_url",
+ "image_url": {
+ "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/RealWorld/RealWorld-04.png"
+ }
+ },
+ {
+ "type": "text",
+ "text": "Where is this?"
+ }
+ ]
+ }
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-4B",
+ messages=messages,
+ max_tokens=32768,
+ temperature=0.7,
+ top_p=0.8,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ "chat_template_kwargs": {"enable_thinking": False},
+ },
+)
+print("Chat response:", chat_response)
+```
+
+> [!Note]
+> If you are using APIs from Alibaba Cloud Model Studio, in addition to changing `model`, please use `"enable_thinking": False` instead of `"chat_template_kwargs": {"enable_thinking": False}`.
+
+
+## Agentic Usage
+
+Qwen3.5 excels in tool calling capabilities.
+
+### Qwen-Agent
+
+We recommend using [Qwen-Agent](https://github.com/QwenLM/Qwen-Agent) to quickly build Agent applications with Qwen3.5.
+
+To define the available tools, you can use the MCP configuration file, use the integrated tool of Qwen-Agent, or integrate other tools by yourself.
+```python
+import os
+from qwen_agent.agents import Assistant
+
+# Define LLM
+# Using Alibaba Cloud Model Studio
+llm_cfg = {
+ # Use the OpenAI-compatible model service provided by DashScope:
+ 'model': 'Qwen3.5-4B',
+ 'model_type': 'qwenvl_oai',
+ 'model_server': 'https://dashscope.aliyuncs.com/compatible-mode/v1',
+ 'api_key': os.getenv('DASHSCOPE_API_KEY'),
+
+ 'generate_cfg': {
+ 'use_raw_api': True,
+ # When using Dash Scope OAI API, pass the parameter of whether to enable thinking mode in this way
+ 'extra_body': {
+ 'enable_thinking': True
+ },
+ },
+}
+
+# Using OpenAI-compatible API endpoint.
+# functionality of the deployment frameworks and let Qwen-Agent automate the related operations.
+#
+# llm_cfg = {
+# # Use your own model service compatible with OpenAI API by vLLM/SGLang:
+# 'model': 'Qwen/Qwen3.5-4B',
+# 'model_type': 'qwenvl_oai',
+# 'model_server': 'http://localhost:8000/v1', # api_base
+# 'api_key': 'EMPTY',
+#
+# 'generate_cfg': {
+# 'use_raw_api': True,
+# # When using vLLM/SGLang OAI API, pass the parameter of whether to enable thinking mode in this way
+# 'extra_body': {
+# 'chat_template_kwargs': {'enable_thinking': True}
+# },
+# },
+# }
+
+# Define Tools
+tools = [
+ {'mcpServers': { # You can specify the MCP configuration file
+ "filesystem": {
+ "command": "npx",
+ "args": ["-y", "@modelcontextprotocol/server-filesystem", "/Users/xxxx/Desktop"]
+ }
+ }
+ }
+]
+
+# Define Agent
+bot = Assistant(llm=llm_cfg, function_list=tools)
+
+# Streaming generation
+messages = [{'role': 'user', 'content': 'Help me organize my desktop.'}]
+for responses in bot.run(messages=messages):
+ pass
+print(responses)
+
+# Streaming generation
+messages = [{'role': 'user', 'content': 'Develop a dog website and save it on the desktop'}]
+for responses in bot.run(messages=messages):
+ pass
+print(responses)
+```
+
+### Qwen Code
+
+
+[Qwen Code](https://github.com/QwenLM/qwen-code) is an open-source AI agent for the terminal, optimized for Qwen models. It helps you understand large codebases, automate tedious work, and ship faster.
+
+For more information, please refer to [Qwen Code](https://qwenlm.github.io/qwen-code-docs/).
+
+## Processing Ultra-Long Texts
+
+Qwen3.5 natively supports context lengths of up to 262,144 tokens.
+For long-horizon tasks where the total length (including both input and output) exceeds this limit, we recommend using RoPE scaling techniques to handle long texts effectively., e.g., YaRN.
+
+YaRN is currently supported by several inference frameworks, e.g., `transformers`, `vllm`, `ktransformers` and `sglang`.
+In general, there are two approaches to enabling YaRN for supported frameworks:
+
+- Modifying the model configuration file:
+ In the `config.json` file, change the `rope_parameters` fields in `text_config` to:
+ ```json
+ {
+ "mrope_interleaved": true,
+ "mrope_section": [
+ 11,
+ 11,
+ 10
+ ],
+ "rope_type": "yarn",
+ "rope_theta": 10000000,
+ "partial_rotary_factor": 0.25,
+ "factor": 4.0,
+ "original_max_position_embeddings": 262144,
+ }
+ ```
+
+- Passing command line arguments:
+
+ For `vllm`, you can use
+ ```shell
+ VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve ... --hf-overrides '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --max-model-len 1010000
+ ```
+
+ For `sglang` and `ktransformers`, you can use
+ ```shell
+ SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server ... --json-model-override-args '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --context-length 1010000
+ ```
+
+> [!NOTE]
+> All the notable open-source frameworks implement static YaRN, which means the scaling factor remains constant regardless of input length, **potentially impacting performance on shorter texts.**
+> We advise modifying the `rope_parameters` configuration only when processing long contexts is required.
+> It is also recommended to modify the `factor` as needed. For example, if the typical context length for your application is 524,288 tokens, it would be better to set `factor` as 2.0.
+
+## Best Practices
+
+To achieve optimal performance, we recommend the following settings:
+
+1. **Sampling Parameters**:
+ - We suggest using the following sets of sampling parameters depending on the mode and task type:
+ - **Thinking mode for general tasks**:
+ `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0`
+ - **Thinking mode for precise coding tasks (e.g., WebDev)**:
+ `temperature=0.6`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0`
+ - **Instruct (or non-thinking) mode for general tasks**:
+ `temperature=0.7`, `top_p=0.8`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0`
+ - **Instruct (or non-thinking) mode for reasoning tasks**:
+ `temperature=1.0`, `top_p=1.0`, `top_k=40`, `min_p=0.0`, `presence_penalty=2.0`, `repetition_penalty=1.0`
+ - For supported frameworks, you can adjust the `presence_penalty` parameter between 0 and 2 to reduce endless repetitions. However, using a higher value may occasionally result in language mixing and a slight decrease in model performance.
+
+2. **Adequate Output Length**: We recommend using an output length of 32,768 tokens for most queries. For benchmarking on highly complex problems, such as those found in math and programming competitions, we suggest setting the max output length to 81,920 tokens. This provides the model with sufficient space to generate detailed and comprehensive responses, thereby enhancing its overall performance.
+
+3. **Standardize Output Format**: We recommend using prompts to standardize model outputs when benchmarking.
+ - **Math Problems**: Include "Please reason step by step, and put your final answer within \boxed{}." in the prompt.
+ - **Multiple-Choice Questions**: Add the following JSON structure to the prompt to standardize responses: "Please show your choice in the `answer` field with only the choice letter, e.g., `"answer": "C"`."
+
+4. **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final output part and does not need to include the thinking content. It is implemented in the provided chat template in Jinja2. However, for frameworks that do not directly use the Jinja2 chat template, it is up to the developers to ensure that the best practice is followed.
+
+5. **Long Video Understanding**: To optimize inference efficiency for plain text and images, the `size` parameter in the released `video_preprocessor_config.json` is conservatively configured. It is recommended to set the `longest_edge` parameter in the video_preprocessor_config file to 469,762,048 (corresponding to 224k video tokens) to enable higher frame-rate sampling for hour-scale videos and thereby achieve superior performance. For example,
+ ```json
+ {"longest_edge": 469762048, "shortest_edge": 4096}
+ ```
+
+ Alternatively, override the default values via engine startup parameters. For implementation details, refer to: [vLLM](https://github.com/vllm-project/vllm/pull/34330) / [SGLang](https://github.com/sgl-project/sglang/pull/18467).
+
+
+### Citation
+
+If you find our work helpful, feel free to give us a cite.
+
+```bibtex
+@misc{qwen3.5,
+ title = {{Qwen3.5}: Towards Native Multimodal Agents},
+ author = {{Qwen Team}},
+ month = {February},
+ year = {2026},
+ url = {https://qwen.ai/blog?id=qwen3.5}
+}
+```
\ No newline at end of file
diff --git a/chat/gguf/unsloth/Qwen3.5-4B-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/Qwen3.5-4B-GGUF/mmproj-F16.gguf
new file mode 100644
index 0000000..df5eff1
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.5-4B-GGUF/mmproj-F16.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:cd88edcf8d031894960bb0c9c5b9b7e1fea6ebee02b9f7ce925a00d12891f864
+size 672423616
diff --git a/chat/gguf/unsloth/Qwen3.5-9B-GGUF/Qwen3.5-9B-Q4_K_M.gguf b/chat/gguf/unsloth/Qwen3.5-9B-GGUF/Qwen3.5-9B-Q4_K_M.gguf
new file mode 100644
index 0000000..111d918
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.5-9B-GGUF/Qwen3.5-9B-Q4_K_M.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:03b74727a860a56338e042c4420bb3f04b2fec5734175f4cb9fa853daf52b7e8
+size 5680522464
diff --git a/chat/gguf/unsloth/Qwen3.5-9B-GGUF/README.md b/chat/gguf/unsloth/Qwen3.5-9B-GGUF/README.md
new file mode 100644
index 0000000..b876513
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.5-9B-GGUF/README.md
@@ -0,0 +1,1199 @@
+---
+tags:
+- unsloth
+library_name: transformers
+license: apache-2.0
+license_link: https://huggingface.co/Qwen/Qwen3.5-9B/blob/main/LICENSE
+pipeline_tag: image-text-to-text
+base_model:
+- Qwen/Qwen3.5-9B
+---
+
+
+
+
+
+ Unsloth Dynamic 2.0 achieves superior accuracy & outperforms other leading quants.
+
+
+
+
+- You can now also fine-tune the model locally with [Unsloth](https://github.com/unslothai/unsloth).
+- Read our [Qwen3.5 fine-tuning guide here](https://unsloth.ai/docs/models/qwen3.5/fine-tune).
+
+---
+
+# Qwen3.5-9B
+
+
+
+[](https://chat.qwen.ai)
+
+> [!Note]
+> This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format.
+>
+> These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, KTransformers, etc.
+
+Over recent months, we have intensified our focus on developing foundation models that deliver exceptional utility and performance. Qwen3.5 represents a significant leap forward, integrating breakthroughs in multimodal learning, architectural efficiency, reinforcement learning scale, and global accessibility to empower developers and enterprises with unprecedented capability and efficiency.
+
+## Qwen3.5 Highlights
+
+Qwen3.5 features the following enhancement:
+
+- **Unified Vision-Language Foundation**: Early fusion training on multimodal tokens achieves cross-generational parity with Qwen3 and outperforms Qwen3-VL models across reasoning, coding, agents, and visual understanding benchmarks.
+
+- **Efficient Hybrid Architecture**: Gated Delta Networks combined with sparse Mixture-of-Experts deliver high-throughput inference with minimal latency and cost overhead.
+
+- **Scalable RL Generalization**: Reinforcement learning scaled across million-agent environments with progressively complex task distributions for robust real-world adaptability.
+
+- **Global Linguistic Coverage**: Expanded support to 201 languages and dialects, enabling inclusive, worldwide deployment with nuanced cultural and regional understanding.
+
+- **Next-Generation Training Infrastructure**: Near-100% multimodal training efficiency compared to text-only training and asynchronous RL frameworks supporting massive-scale agent scaffolds and environment orchestration.
+
+
+
+
+For more details, please refer to our blog post [Qwen3.5](https://qwen.ai/blog?id=qwen3.5).
+
+
+## Model Overview
+
+- Type: Causal Language Model with Vision Encoder
+- Training Stage: Pre-training & Post-training
+- Language Model
+ - Number of Parameters: 9B
+ - Hidden Dimension: 4096
+ - Token Embedding: 248320 (Padded)
+ - Number of Layers: 32
+ - Hidden Layout: 8 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))
+ - Gated DeltaNet:
+ - Number of Linear Attention Heads: 32 for V and 16 for QK
+ - Head Dimension: 128
+ - Gated Attention:
+ - Number of Attention Heads: 16 for Q and 4 for KV
+ - Head Dimension: 256
+ - Rotary Position Embedding Dimension: 64
+ - Feed Forward Network:
+ - Intermediate Dimension: 12288
+ - LM Output: 248320 (Padded)
+ - MTP: trained with multi-steps
+- Context Length: 262,144 natively and extensible up to 1,010,000 tokens.
+
+## Benchmark Results
+
+### Language
+
+
+
+
+GPT-OSS-120B GPT-OSS-20B Qwen3-Next-80B-A3B-Thinking Qwen3-30BA3B-Thinking-2507 Qwen3.5-9B Qwen3.5-4B
+
+Knowledge & STEM
+
+MMLU-Pro
+80.8
+74.8
+82.7
+80.9
+82.5
+79.1
+
+
+MMLU-Redux
+91.0
+87.8
+92.5
+91.4
+91.1
+88.8
+
+
+C-Eval
+76.2
+71.4
+89.7
+87.4
+88.2
+85.1
+
+
+SuperGPQA
+54.6
+48.5
+60.8
+56.8
+58.2
+52.9
+
+
+GPQA Diamond
+80.1
+71.5
+77.2
+73.4
+81.7
+76.2
+
+Instruction Following
+
+IFEval
+88.9
+88.2
+88.9
+88.9
+91.5
+89.8
+
+
+IFBench
+69.0
+65.1
+61.5
+51.5
+64.5
+59.2
+
+
+MultiChallenge
+45.3
+40.1
+51.3
+46.5
+54.5
+49.0
+
+Long Context
+
+AA-LCR
+50.7
+30.7
+51.7
+49.0
+63.0
+57.0
+
+
+LongBench v2
+48.2
+45.6
+48.0
+44.8
+55.2
+50.0
+
+Reasoning & Coding
+
+HMMT Feb 25
+90.0
+76.7
+73.7
+63.1
+83.2
+74.0
+
+
+HMMT Nov 25
+90.0
+81.8
+81.2
+73.8
+82.9
+76.8
+
+
+LiveCodeBench v6
+82.7
+74.6
+68.7
+66.0
+65.6
+55.8
+
+
+OJBench
+41.5
+36.3
+29.7
+25.1
+29.2
+24.1
+
+General Agent
+
+BFCL-V4
+--
+--
+49.7
+42.4
+66.1
+50.3
+
+
+TAU2-Bench
+--
+--
+57.4
+41.9
+79.1
+79.9
+
+
+VITA-Bench
+--
+--
+29.5
+14.1
+29.8
+22.0
+
+
+DeepPlanning
+--
+--
+0.4
+4.9
+18.0
+17.6
+
+Multilingualism
+
+MMMLU
+78.2
+69.7
+81.3
+78.4
+81.2
+76.1
+
+
+MMLU-ProX
+74.5
+67.3
+73.6
+69.1
+76.3
+71.5
+
+
+NOVA-63
+51.1
+48.7
+53.3
+52.5
+55.9
+54.3
+
+
+INCLUDE
+74.0
+65.3
+78.3
+74.4
+75.6
+71.0
+
+
+Global PIQA
+84.1
+79.8
+83.5
+80.2
+83.2
+78.9
+
+
+PolyMATH
+54.0
+30.9
+62.4
+52.6
+57.3
+51.1
+
+
+WMT24++
+74.4
+67.8
+57.4
+69.3
+72.6
+66.6
+
+
+MAXIFE
+83.7
+80.1
+79.9
+77.4
+83.4
+78.0
+
+
+
+
+* TAU2-Bench: we follow the official setup except for the airline domain, where all models are evaluated by applying the fixes proposed in the Claude Opus 4.5 system card.
+
+* MMLU-ProX: we report the averaged accuracy on 29 languages.
+* WMT24++: a harder subset of WMT24 after difficulty labeling and rebalancing; we report the averaged scores on 55 languages using XCOMET-XXL.
+* MAXIFE: we report the accuracy on English + multilingual original prompts (totally 23 settings).
+* Empty cells (--) indicate scores not yet available or not applicable.
+
+
+
+
+### Vision Language
+
+
+
+
+GPT-5-Nano-2025-08-07 Gemini-2.5-Flash-Lite Qwen3-VL-30B-A3B Qwen3.5-9B Qwen3.5-4B
+
+STEM and Puzzle
+
+MMMU
+75.8
+73.4
+76.0
+78.4
+77.6
+
+
+MMMU-Pro
+57.2
+59.7
+63.0
+70.1
+66.3
+
+
+MathVision
+62.2
+52.1
+65.7
+78.9
+74.6
+
+
+Mathvista(mini)
+71.5
+72.8
+81.9
+85.7
+85.1
+
+
+We-Math
+62.5
+32.1
+70.0
+75.2
+75.4
+
+
+DynaMath
+78.0
+69.9
+80.1
+83.6
+83.3
+
+
+ZEROBench
+1.0
+1.0
+0.0
+3.0
+3.0
+
+
+ZEROBench_sub
+22.2
+19.2
+23.7
+31.1
+26.3
+
+
+VlmsAreBlind
+66.7
+68.4
+72.5
+93.7
+92.6
+
+
+BabyVision
+14.4
+17.5
+18.6
+28.6/25.8
+16.0/19.1
+
+General VQA
+
+RealWorldQA
+71.8
+72.2
+77.4
+80.3
+79.5
+
+
+MMStar
+68.6
+69.1
+75.5
+79.7
+78.3
+
+
+MMBenchEN-DEV-v1.1
+80.3
+82.7
+88.9
+90.1
+89.4
+
+
+SimpleVQA
+46.0
+54.1
+54.3
+51.2
+43.4
+
+
+HallusionBench
+58.4
+64.5
+66.0
+69.3
+65.0
+
+Text Recognition and Document Understanding
+
+OmniDocBench1.5
+55.9
+79.4
+86.8
+87.7
+86.2
+
+
+CharXiv(RQ)
+50.1
+56.1
+56.6
+73.0
+70.8
+
+
+MMLongBench-Doc
+31.8
+46.5
+47.4
+57.7
+54.2
+
+
+CC-OCR
+58.9
+72.9
+77.8
+79.3
+76.7
+
+
+AI2D_TEST
+81.9
+85.7
+86.9
+90.2
+89.6
+
+
+OCRBench
+75.3
+82.5
+83.9
+89.2
+85.0
+
+Spatial Intelligence
+
+ERQA
+45.8
+44.3
+45.3
+55.5
+54.0
+
+
+CountBench
+80.0
+79.2
+90.0
+97.2
+96.3
+
+
+RefCOCO(avg)
+--
+--
+89.3
+89.7
+88.1
+
+
+EmbSpatialBench
+74.2
+66.1
+80.6
+83.0
+81.3
+
+
+RefSpatialBench
+12.6
+11.2
+54.2
+58.5
+54.6
+
+
+LingoQA
+57.0
+17.8
+62.0
+80.4
+74.4
+
+
+Hypersim
+--
+--
+11.4
+13.5
+12.5
+
+
+Nuscene
+--
+--
+10.3
+11.8
+9.9
+
+Video Understanding
+
+VideoMME(w sub.)
+71.7
+74.6
+79.9
+84.5
+83.5
+
+
+VideoMME(w/o sub.)
+66.2
+72.7
+73.3
+78.4
+76.9
+
+
+VideoMMMU
+63.0
+69.2
+75.0
+78.9
+74.1
+
+
+MLVU
+69.2
+78.5
+78.9
+84.4
+82.8
+
+
+MVBench
+--
+--
+72.0
+74.4
+71.2
+
+
+LVBench
+--
+60.9
+59.2
+70.0
+66.4
+
+
+MMVU
+63.1
+65.3
+66.1
+67.8
+64.9
+
+Visual Agent
+
+ScreenSpot Pro
+--
+--
+60.5
+65.2
+60.3
+
+
+OSWorld-Verified
+--
+--
+30.6
+41.8
+35.6
+
+
+AndroidWorld
+--
+--
+55.0
+57.8
+58.6
+
+Tool Calling
+
+TIR-Bench
+18.5
+21.5
+22.5
+45.6/31.9
+38.9/29.9
+
+
+V*
+68.1
+69.6
+83.2
+90.1/88.5
+84.3/86.4
+
+Medical VQA
+
+SLAKE
+57.0
+65.0
+68.8
+79.0
+76.1
+
+
+PMC-VQA
+37.8
+48.8
+51.5
+57.9
+55.5
+
+
+MedXpertQA-MM
+26.7
+35.3
+35.5
+49.9
+42.9
+
+
+
+
+
+* MathVision: our model’s score is evaluated using a fixed prompt, e.g., “Please reason step by step, and put your final answer within \boxed{}.” For other models, we report the higher score between runs with and without the \boxed{} formatting.
+* BabyVision: scores reported as "with CI / without CI".
+* TIR-Bench and V*: scores reported as "with CI / without CI".
+* Empty cells (--) indicate scores not yet available or not applicable.
+
+
+
+
+## Quickstart
+
+> [!Important]
+> Qwen3.5 models operate in thinking mode by default, generating thinking content signified by `\n... \n\n` before producing the final responses.
+> To disable thinking content and obtain direct response, refer to the examples [here](#instruct-or-non-thinking-mode).
+
+
+For streamlined integration, we recommend using Qwen3.5 via APIs. Below is a guide to use Qwen3.5 via OpenAI-compatible API.
+
+### Serving Qwen3.5
+
+Qwen3.5 can be served via APIs with popular inference frameworks.
+In the following, we show example commands to launch OpenAI-Compatible API servers for Qwen3.5 models.
+
+
+> [!Important]
+> Inference efficiency and throughput vary significantly across frameworks.
+> We recommend using the latest framework versions to ensure optimal performance and compatibility.
+> For production workloads or high-throughput scenarios, dedicated serving engines such as SGLang, KTransformers or vLLM are strongly recommended.
+
+> [!Important]
+> The model has a default context length of 262,144 tokens.
+> If you encounter out-of-memory (OOM) errors, consider reducing the context window.
+> However, because Qwen3.5 leverages extended context for complex tasks, we advise maintaining a context length of at least 128K tokens to preserve thinking capabilities.
+
+#### SGLang
+
+[SGLang](https://github.com/sgl-project/sglang) is a fast serving framework for large language models and vision language models.
+SGLang from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment:
+```shell
+uv pip install 'git+https://github.com/sgl-project/sglang.git#subdirectory=python&egg=sglang[all]'
+```
+See [its documentation](https://docs.sglang.ai/get_started/install.html) for more details.
+
+The following will create API endpoints at `http://localhost:8000/v1`:
+
+- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs.
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.5-9B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3
+ ```
+
+- **Tool Use**: To support tool use, you can use the following command.
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.5-9B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_coder
+ ```
+
+- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP:
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.5-9B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --speculative-algo NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4
+ ```
+
+#### vLLM
+
+[vLLM](https://github.com/vllm-project/vllm) is a high-throughput and memory-efficient inference and serving engine for LLMs.
+vLLM from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment:
+```shell
+uv pip install vllm --torch-backend=auto --extra-index-url https://wheels.vllm.ai/nightly
+```
+See [its documentation](https://docs.vllm.ai/en/stable/getting_started/installation/index.html) for more details.
+
+For detailed Qwen3.5 usage guide, see the [vLLM Qwen3.5 recipe](https://docs.vllm.ai/projects/recipes/en/latest/Qwen/Qwen3.5.html).
+
+The following will create API endpoints at `http://localhost:8000/v1`:
+
+- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs.
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-9B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3
+ ```
+
+- **Tool Call**: To support tool use, you can use the following command.
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-9B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
+ ```
+
+- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP:
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-9B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 --speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}'
+ ```
+
+- **Text-Only**: The following command skips the vision encoder and multimodal profiling to free up memory for additional KV cache:
+
+ ```shell
+ vllm serve Qwen/Qwen3.5-9B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 --language-model-only
+ ```
+
+#### KTransformers
+
+[KTransformers](https://github.com/kvcache-ai/ktransformers) is a flexible framework for experiencing cutting-edge LLM inference optimizations with CPU-GPU heterogeneous computing.
+For running Qwen3.5 with KTransformers, see the [KTransformers Deployment Guide](https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/Qwen3.5.md).
+
+#### Hugging Face Transformers
+
+Hugging Face Transformers contains a _lightweight_ server which can be used for quick testing and moderate load deployment.
+The latest `transformers` is required for Qwen3.5:
+```shell
+pip install "transformers[serving] @ git+https://github.com/huggingface/transformers.git@main"
+```
+See [its documentation](https://huggingface.co/docs/transformers/main/serving) for more details. Please also make sure torchvision and pillow are installed.
+
+Then, run `transformers serve` to launch a server with API endpoints at `http://localhost:8000/v1`; it will place the model on accelerators if available:
+```shell
+transformers serve --force-model Qwen/Qwen3.5-9B --port 8000 --continuous-batching
+```
+
+### Using Qwen3.5 via the Chat Completions API
+
+The chat completions API is accessible via standard HTTP requests or OpenAI SDKs.
+Here, we show examples using the OpenAI Python SDK.
+
+Before starting, make sure it is installed and the API key and the API base URL is configured, e.g.:
+```shell
+pip install -U openai
+
+# Set the following accordingly
+export OPENAI_BASE_URL="http://localhost:8000/v1"
+export OPENAI_API_KEY="EMPTY"
+```
+
+> [!Tip]
+> We recommend using the following set of sampling parameters for generation
+> - Thinking mode for general tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0`
+> - Thinking mode for precise coding tasks (e.g. WebDev): `temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0`
+> - Instruct (or non-thinking) mode for general tasks: `temperature=0.7, top_p=0.8, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0`
+> - Instruct (or non-thinking) mode for reasoning tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0`
+>
+> Please note that the support for sampling parameters varies according to inference frameworks.
+
+#### Text-Only Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {"role": "user", "content": "Type \"I love Qwen3.5\" backwards"},
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-9B",
+ messages=messages,
+ max_tokens=81920,
+ temperature=1.0,
+ top_p=0.95,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ },
+)
+print("Chat response:", chat_response)
+```
+
+
+#### Image Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {
+ "type": "image_url",
+ "image_url": {
+ "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg"
+ }
+ },
+ {
+ "type": "text",
+ "text": "The centres of the four illustrated circles are in the corners of the square. The two big circles touch each other and also the two little circles. With which factor do you have to multiply the radii of the little circles to obtain the radius of the big circles?\nChoices:\n(A) $\\frac{2}{9}$\n(B) $\\sqrt{5}$\n(C) $0.8 \\cdot \\pi$\n(D) 2.5\n(E) $1+\\sqrt{2}$"
+ }
+ ]
+ }
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-9B",
+ messages=messages,
+ max_tokens=81920,
+ temperature=1.0,
+ top_p=0.95,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ },
+)
+print("Chat response:", chat_response)
+```
+
+#### Video Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {
+ "type": "video_url",
+ "video_url": {
+ "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4"
+ }
+ },
+ {
+ "type": "text",
+ "text": "Summarize the video content."
+ }
+ ]
+ }
+]
+
+# When vLLM is launched with `--media-io-kwargs '{"video": {"num_frames": -1}}'`,
+# video frame sampling can be configured via `extra_body` (e.g., by setting `fps`).
+# This feature is currently supported only in vLLM.
+#
+# By default, `fps=2` and `do_sample_frames=True`.
+# With `do_sample_frames=True`, you can customize the `fps` value to set your desired video sampling rate.
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-9B",
+ messages=messages,
+ max_tokens=81920,
+ temperature=1.0,
+ top_p=0.95,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True},
+ },
+)
+
+print("Chat response:", chat_response)
+```
+
+#### Instruct (or Non-Thinking) Mode
+
+> [!Important]
+> Qwen3.5 does not officially support the soft switch of Qwen3, i.e., `/think` and `/nothink`.
+
+Qwen3.5 will think by default before response.
+You can obtain direct response from the model without thinking by configuring the API parameters.
+For example,
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {
+ "type": "image_url",
+ "image_url": {
+ "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/RealWorld/RealWorld-04.png"
+ }
+ },
+ {
+ "type": "text",
+ "text": "Where is this?"
+ }
+ ]
+ }
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.5-9B",
+ messages=messages,
+ max_tokens=32768,
+ temperature=0.7,
+ top_p=0.8,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ "chat_template_kwargs": {"enable_thinking": False},
+ },
+)
+print("Chat response:", chat_response)
+```
+
+> [!Note]
+> If you are using APIs from Alibaba Cloud Model Studio, in addition to changing `model`, please use `"enable_thinking": False` instead of `"chat_template_kwargs": {"enable_thinking": False}`.
+
+
+## Agentic Usage
+
+Qwen3.5 excels in tool calling capabilities.
+
+### Qwen-Agent
+
+We recommend using [Qwen-Agent](https://github.com/QwenLM/Qwen-Agent) to quickly build Agent applications with Qwen3.5.
+
+To define the available tools, you can use the MCP configuration file, use the integrated tool of Qwen-Agent, or integrate other tools by yourself.
+```python
+import os
+from qwen_agent.agents import Assistant
+
+# Define LLM
+# Using Alibaba Cloud Model Studio
+llm_cfg = {
+ # Use the OpenAI-compatible model service provided by DashScope:
+ 'model': 'Qwen3.5-9B',
+ 'model_type': 'qwenvl_oai',
+ 'model_server': 'https://dashscope.aliyuncs.com/compatible-mode/v1',
+ 'api_key': os.getenv('DASHSCOPE_API_KEY'),
+
+ 'generate_cfg': {
+ 'use_raw_api': True,
+ # When using Dash Scope OAI API, pass the parameter of whether to enable thinking mode in this way
+ 'extra_body': {
+ 'enable_thinking': True
+ },
+ },
+}
+
+# Using OpenAI-compatible API endpoint.
+# functionality of the deployment frameworks and let Qwen-Agent automate the related operations.
+#
+# llm_cfg = {
+# # Use your own model service compatible with OpenAI API by vLLM/SGLang:
+# 'model': 'Qwen/Qwen3.5-9B',
+# 'model_type': 'qwenvl_oai',
+# 'model_server': 'http://localhost:8000/v1', # api_base
+# 'api_key': 'EMPTY',
+#
+# 'generate_cfg': {
+# 'use_raw_api': True,
+# # When using vLLM/SGLang OAI API, pass the parameter of whether to enable thinking mode in this way
+# 'extra_body': {
+# 'chat_template_kwargs': {'enable_thinking': True}
+# },
+# },
+# }
+
+# Define Tools
+tools = [
+ {'mcpServers': { # You can specify the MCP configuration file
+ "filesystem": {
+ "command": "npx",
+ "args": ["-y", "@modelcontextprotocol/server-filesystem", "/Users/xxxx/Desktop"]
+ }
+ }
+ }
+]
+
+# Define Agent
+bot = Assistant(llm=llm_cfg, function_list=tools)
+
+# Streaming generation
+messages = [{'role': 'user', 'content': 'Help me organize my desktop.'}]
+for responses in bot.run(messages=messages):
+ pass
+print(responses)
+
+# Streaming generation
+messages = [{'role': 'user', 'content': 'Develop a dog website and save it on the desktop'}]
+for responses in bot.run(messages=messages):
+ pass
+print(responses)
+```
+
+### Qwen Code
+
+
+[Qwen Code](https://github.com/QwenLM/qwen-code) is an open-source AI agent for the terminal, optimized for Qwen models. It helps you understand large codebases, automate tedious work, and ship faster.
+
+For more information, please refer to [Qwen Code](https://qwenlm.github.io/qwen-code-docs/).
+
+## Processing Ultra-Long Texts
+
+Qwen3.5 natively supports context lengths of up to 262,144 tokens.
+For long-horizon tasks where the total length (including both input and output) exceeds this limit, we recommend using RoPE scaling techniques to handle long texts effectively., e.g., YaRN.
+
+YaRN is currently supported by several inference frameworks, e.g., `transformers`, `vllm`, `ktransformers` and `sglang`.
+In general, there are two approaches to enabling YaRN for supported frameworks:
+
+- Modifying the model configuration file:
+ In the `config.json` file, change the `rope_parameters` fields in `text_config` to:
+ ```json
+ {
+ "mrope_interleaved": true,
+ "mrope_section": [
+ 11,
+ 11,
+ 10
+ ],
+ "rope_type": "yarn",
+ "rope_theta": 10000000,
+ "partial_rotary_factor": 0.25,
+ "factor": 4.0,
+ "original_max_position_embeddings": 262144,
+ }
+ ```
+
+- Passing command line arguments:
+
+ For `vllm`, you can use
+ ```shell
+ VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve ... --hf-overrides '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --max-model-len 1010000
+ ```
+
+ For `sglang` and `ktransformers`, you can use
+ ```shell
+ SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server ... --json-model-override-args '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --context-length 1010000
+ ```
+
+> [!NOTE]
+> All the notable open-source frameworks implement static YaRN, which means the scaling factor remains constant regardless of input length, **potentially impacting performance on shorter texts.**
+> We advise modifying the `rope_parameters` configuration only when processing long contexts is required.
+> It is also recommended to modify the `factor` as needed. For example, if the typical context length for your application is 524,288 tokens, it would be better to set `factor` as 2.0.
+
+## Best Practices
+
+To achieve optimal performance, we recommend the following settings:
+
+1. **Sampling Parameters**:
+ - We suggest using the following sets of sampling parameters depending on the mode and task type:
+ - **Thinking mode for general tasks**:
+ `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0`
+ - **Thinking mode for precise coding tasks (e.g., WebDev)**:
+ `temperature=0.6`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0`
+ - **Instruct (or non-thinking) mode for general tasks**:
+ `temperature=0.7`, `top_p=0.8`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0`
+ - **Instruct (or non-thinking) mode for reasoning tasks**:
+ `temperature=1.0`, `top_p=1.0`, `top_k=40`, `min_p=0.0`, `presence_penalty=2.0`, `repetition_penalty=1.0`
+ - For supported frameworks, you can adjust the `presence_penalty` parameter between 0 and 2 to reduce endless repetitions. However, using a higher value may occasionally result in language mixing and a slight decrease in model performance.
+
+2. **Adequate Output Length**: We recommend using an output length of 32,768 tokens for most queries. For benchmarking on highly complex problems, such as those found in math and programming competitions, we suggest setting the max output length to 81,920 tokens. This provides the model with sufficient space to generate detailed and comprehensive responses, thereby enhancing its overall performance.
+
+3. **Standardize Output Format**: We recommend using prompts to standardize model outputs when benchmarking.
+ - **Math Problems**: Include "Please reason step by step, and put your final answer within \boxed{}." in the prompt.
+ - **Multiple-Choice Questions**: Add the following JSON structure to the prompt to standardize responses: "Please show your choice in the `answer` field with only the choice letter, e.g., `"answer": "C"`."
+
+4. **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final output part and does not need to include the thinking content. It is implemented in the provided chat template in Jinja2. However, for frameworks that do not directly use the Jinja2 chat template, it is up to the developers to ensure that the best practice is followed.
+
+5. **Long Video Understanding**: To optimize inference efficiency for plain text and images, the `size` parameter in the released `video_preprocessor_config.json` is conservatively configured. It is recommended to set the `longest_edge` parameter in the video_preprocessor_config file to 469,762,048 (corresponding to 224k video tokens) to enable higher frame-rate sampling for hour-scale videos and thereby achieve superior performance. For example,
+ ```json
+ {"longest_edge": 469762048, "shortest_edge": 4096}
+ ```
+
+ Alternatively, override the default values via engine startup parameters. For implementation details, refer to: [vLLM](https://github.com/vllm-project/vllm/pull/34330) / [SGLang](https://github.com/sgl-project/sglang/pull/18467).
+
+
+### Citation
+
+If you find our work helpful, feel free to give us a cite.
+
+```bibtex
+@misc{qwen3.5,
+ title = {{Qwen3.5}: Towards Native Multimodal Agents},
+ author = {{Qwen Team}},
+ month = {February},
+ year = {2026},
+ url = {https://qwen.ai/blog?id=qwen3.5}
+}
+```
\ No newline at end of file
diff --git a/chat/gguf/unsloth/Qwen3.5-9B-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/Qwen3.5-9B-GGUF/mmproj-F16.gguf
new file mode 100644
index 0000000..61292b5
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.5-9B-GGUF/mmproj-F16.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:f70dc3509053962b0d0d3ee8a7eacebf5d60aa560cad78254ae8698516ae029f
+size 918166080
diff --git a/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf b/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf
new file mode 100644
index 0000000..c5100a3
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ac0e2c1189e055faa36eff361580e79c5bd6f8e76bffb4ce547f167d53e31a61
+size 22134528992
diff --git a/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/README.md b/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/README.md
new file mode 100644
index 0000000..166561e
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/README.md
@@ -0,0 +1,1073 @@
+---
+library_name: transformers
+license: apache-2.0
+license_link: https://huggingface.co/Qwen/Qwen3.6-35B-A3B/blob/main/LICENSE
+pipeline_tag: image-text-to-text
+base_model:
+- Qwen/Qwen3.6-35B-A3B
+tags:
+- unsloth
+- qwen
+- qwen3_5_moe
+---
+# Read our How to [Run Qwen3.6 Guide!](https://docs.unsloth.ai/models/qwen3.6)
+
+
+ See Unsloth Dynamic 2.0 GGUFs for our quantization benchmarks.
+
+
+
+ NEW: Developer Role Support so Qwen3.6 can work in Codex, OpenCode and more!
+ Qwen3.6 can now be run and fine-tuned in Unsloth Studio . Read our guide .
+ Tool calling improvements: Makes parsing nested objects to make tool calling succeed more.
+ Example of Qwen3.6 (4-bit GGUF) running in Unsloth Studio with tool-calling:
+
+
+
+
+---
+
+# Qwen3.6-35B-A3B
+
+
+
+[](https://chat.qwen.ai)
+
+> [!Note]
+> This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format.
+>
+> These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, KTransformers, etc.
+
+Following the February release of the Qwen3.5 series, we're pleased to share the first open-weight variant of Qwen3.6. Built on direct feedback from the community, Qwen3.6 prioritizes stability and real-world utility, offering developers a more intuitive, responsive, and genuinely productive coding experience.
+
+## Qwen3.6 Highlights
+
+This release delivers substantial upgrades, particularly in
+
+- **Agentic Coding:** the model now handles frontend workflows and repository-level reasoning with greater fluency and precision.
+- **Thinking Preservation:** we've introduced a new option to retain reasoning context from historical messages, streamlining iterative development and reducing overhead.
+
+
+
+For more details, please refer to our blog post [Qwen3.6-35B-A3B](https://qwen.ai/blog?id=qwen3.6-35b-a3b).
+
+## Model Overview
+
+- Type: Causal Language Model with Vision Encoder
+- Training Stage: Pre-training & Post-training
+- Language Model
+ - Number of Parameters: 35B in total and 3B activated
+ - Hidden Dimension: 2048
+ - Token Embedding: 248320 (Padded)
+ - Number of Layers: 40
+ - Hidden Layout: 10 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE))
+ - Gated DeltaNet:
+ - Number of Linear Attention Heads: 32 for V and 16 for QK
+ - Head Dimension: 128
+ - Gated Attention:
+ - Number of Attention Heads: 16 for Q and 2 for KV
+ - Head Dimension: 256
+ - Rotary Position Embedding Dimension: 64
+ - Mixture Of Experts
+ - Number of Experts: 256
+ - Number of Activated Experts: 8 Routed + 1 Shared
+ - Expert Intermediate Dimension: 512
+ - LM Output: 248320 (Padded)
+ - MTP: trained with multi-steps
+- Context Length: 262,144 natively and extensible up to 1,010,000 tokens.
+
+
+## Benchmark Results
+
+### Language
+
+
+
+
+Qwen3.5-27B Gemma4-31B Qwen3.5-35BA3B Gemma4-26BA4B Qwen3.6-35BA3B
+
+Coding Agent
+
+SWE-bench Verified
+75.0
+52.0
+70.0
+17.4
+73.4
+
+
+SWE-bench Multilingual
+69.3
+51.7
+60.3
+17.3
+67.2
+
+
+SWE-bench Pro
+51.2
+35.7
+44.6
+13.8
+49.5
+
+
+Terminal-Bench 2.0
+41.6
+42.9
+40.5
+34.2
+51.5
+
+
+Claw-Eval Avg
+64.3
+48.5
+65.4
+58.8
+68.7
+
+
+Claw-Eval Pass^3
+46.2
+25.0
+51.0
+28.0
+50.0
+
+
+SkillsBench Avg5
+27.2
+23.6
+4.4
+12.3
+28.7
+
+
+QwenClawBench
+52.2
+41.7
+47.7
+38.7
+52.6
+
+
+NL2Repo
+27.3
+15.5
+20.5
+11.6
+29.4
+
+
+QwenWebBench
+1068
+1197
+978
+1178
+1397
+
+General Agent
+
+TAU3-Bench
+68.4
+67.5
+68.9
+59.0
+67.2
+
+
+VITA-Bench
+41.8
+43.0
+29.1
+36.9
+35.6
+
+
+DeepPlanning
+22.6
+24.0
+22.8
+16.2
+25.9
+
+
+Tool Decathlon
+31.5
+21.2
+28.7
+12.0
+26.9
+
+
+MCPMark
+36.3
+18.1
+27.0
+14.2
+37.0
+
+
+MCP-Atlas
+68.4
+57.2
+62.4
+50.0
+62.8
+
+
+WideSearch
+66.4
+35.2
+59.1
+38.3
+60.1
+
+Knowledge
+
+MMLU-Pro
+86.1
+85.2
+85.3
+82.6
+85.2
+
+
+MMLU-Redux
+93.2
+93.7
+93.3
+92.7
+93.3
+
+
+SuperGPQA
+65.6
+65.7
+63.4
+61.4
+64.7
+
+
+C-Eval
+90.5
+82.6
+90.2
+82.5
+90.0
+
+STEM & Reasoning
+
+GPQA
+85.5
+84.3
+84.2
+82.3
+86.0
+
+
+HLE
+24.3
+19.5
+22.4
+8.7
+21.4
+
+
+LiveCodeBench v6
+80.7
+80.0
+74.6
+77.1
+80.4
+
+
+HMMT Feb 25
+92.0
+88.7
+89.0
+91.7
+90.7
+
+
+HMMT Nov 25
+89.8
+87.5
+89.2
+87.5
+89.1
+
+
+HMMT Feb 26
+84.3
+77.2
+78.7
+79.0
+83.6
+
+
+IMOAnswerBench
+79.9
+74.5
+76.8
+74.3
+78.9
+
+
+AIME26
+92.6
+89.2
+91.0
+88.3
+92.7
+
+
+
+
+
+* SWE-Bench Series: Internal agent scaffold (bash + file-edit tools); temp=1.0, top_p=0.95, 200K context window. We correct some problematic tasks in the public set of SWE-bench Pro and evaluate all baselines on the refined benchmark.
+* Terminal-Bench 2.0: Harbor/Terminus-2 harness; 3h timeout, 32 CPU/48 GB RAM; temp=1.0, top_p=0.95, top_k=20, max_tokens=80K, 256K ctx; avg of 5 runs.
+* SkillsBench: Evaluated via OpenCode on 78 tasks (self-contained subset, excluding API-dependent tasks); avg of 5 runs.
+* NL2Repo: Others are evaluated via Claude Code (temp=1.0, top_p=0.95, max_turns=900).
+* QwenClawBench: An internal real-user-distribution Claw agent benchmark (open-sourcing soon); temp=0.6, 256K ctx.
+* QwenWebBench: An internal front-end code generation benchmark; bilingual (EN/CN), 7 categories (Web Design, Web Apps, Games, SVG, Data Visualization, Animation, and 3D); auto-render + multimodal judge (code/visual correctness); BT/Elo rating system.
+* TAU3-Bench: We use the official user model (gpt-5.2, low reasoning effort) + default BM25 retrieval.
+* VITA-Bench: Avg subdomain scores; using claude-4-sonnet as judger, as the official judger (claude-3.7-sonnet) is no longer available.
+* MCPMark: GitHub MCP v0.30.3; Playwright responses truncated at 32K tokens.
+* MCP-Atlas: Public set score; gemini-2.5-pro judger.
+* AIME 26: We use the full AIME 2026 (I & II), where the scores may differ from Qwen 3.5 notes.
+
+
+
+
+
+### Vision Language
+
+
+
+
+Qwen3.5-27B Claude-Sonnet-4.5 Gemma4-31B Gemma4-26BA4B Qwen3.5-35B-A3B Qwen3.6-35B-A3B
+
+STEM and Puzzle
+
+MMMU
+82.3
+79.6
+80.4
+78.4
+81.4
+81.7
+
+
+MMMU-Pro
+75.0
+68.4
+76.9*
+73.8*
+75.1
+75.3
+
+
+Mathvista(mini)
+87.8
+79.8
+79.3
+79.4
+86.2
+86.4
+
+
+ZEROBench_sub
+36.2
+26.3
+26.0
+26.3
+34.1
+34.4
+
+General VQA
+
+RealWorldQA
+83.7
+70.3
+72.3
+72.2
+84.1
+85.3
+
+
+MMBenchEN-DEV-v1.1
+92.6
+88.3
+90.9
+89.0
+91.5
+92.8
+
+
+SimpleVQA
+56.0
+57.6
+52.9
+52.2
+58.3
+58.9
+
+
+HallusionBench
+70.0
+59.9
+67.4
+66.1
+67.9
+69.8
+
+Text Recognition and Document Understanding
+
+OmniDocBench1.5
+88.9
+85.8
+80.1
+74.4
+89.3
+89.9
+
+
+CharXiv(RQ)
+79.5
+67.2
+67.9
+69.0
+77.5
+78.0
+
+
+CC-OCR
+81.0
+68.1
+75.7
+74.5
+80.7
+81.9
+
+
+AI2D_TEST
+92.9
+87.0
+89.0
+88.3
+92.6
+92.7
+
+Spatial Intelligence
+
+RefCOCO(avg)
+90.9
+--
+--
+--
+89.2
+92.0
+
+
+ODInW13
+41.1
+--
+--
+--
+42.6
+50.8
+
+
+EmbSpatialBench
+84.5
+71.8
+--
+--
+83.1
+84.3
+
+
+RefSpatialBench
+67.7
+--
+--
+--
+63.5
+64.3
+
+Video Understanding
+
+VideoMME(w sub.)
+87.0
+81.1
+--
+--
+86.6
+86.6
+
+
+VideoMME(w/o sub.)
+82.8
+75.3
+--
+--
+82.5
+82.5
+
+
+VideoMMMU
+82.3
+77.6
+81.6
+76.0
+80.4
+83.7
+
+
+MLVU
+85.9
+72.8
+--
+--
+85.6
+86.2
+
+
+MVBench
+74.6
+--
+--
+--
+74.8
+74.6
+
+
+LVBench
+73.6
+--
+--
+--
+71.4
+71.4
+
+
+
+
+* Empty cells (--) indicate scores not available or not applicable.
+
+
+
+## Quickstart
+
+For streamlined integration, we recommend using Qwen3.6 via APIs. Below is a guide to use Qwen3.6 via OpenAI-compatible API.
+
+### Serving Qwen3.6
+
+Qwen3.6 can be served via APIs with popular inference frameworks.
+In the following, we show example commands to launch OpenAI-Compatible API servers for Qwen3.6 models.
+
+> [!Important]
+> Inference efficiency and throughput vary significantly across frameworks.
+> We recommend using the latest framework versions to ensure optimal performance and compatibility.
+> For production workloads or high-throughput scenarios, dedicated serving engines such as SGLang, KTransformers or vLLM are strongly recommended.
+
+> [!Important]
+> The model has a default context length of 262,144 tokens.
+> If you encounter out-of-memory (OOM) errors, consider reducing the context window.
+> However, because Qwen3.6 leverages extended context for complex tasks, we advise maintaining a context length of at least 128K tokens to preserve thinking capabilities.
+
+#### SGLang
+
+[SGLang](https://github.com/sgl-project/sglang) is a fast serving framework for large language models and vision language models.
+`sglang>=0.5.10` is recommended for Qwen3.6, which can be installed using the following command in a fresh environment:
+```shell
+uv pip install sglang[all]
+```
+See [its documentation](https://docs.sglang.ai/get_started/install.html) for more details.
+
+The following will create API endpoints at `http://localhost:8000/v1`:
+
+- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs.
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.6-35B-A3B --port 8000 --tp-size 8 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3
+ ```
+
+- **Tool Use**: To support tool use, you can use the following command.
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.6-35B-A3B --port 8000 --tp-size 8 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_coder
+ ```
+
+- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP:
+
+ ```shell
+ python -m sglang.launch_server --model-path Qwen/Qwen3.6-35B-A3B --port 8000 --tp-size 8 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --speculative-algo NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4
+ ```
+
+For detailed deployment guide, see the [SGLang Qwen3.5 Cookbook](https://lmsysorg.mintlify.app/cookbook/llm/Qwen/Qwen3.5).
+
+#### vLLM
+
+[vLLM](https://github.com/vllm-project/vllm) is a high-throughput and memory-efficient inference and serving engine for LLMs.
+`vllm>=0.19.0` is recommended for Qwen3.6, which can be installed using the following command in a fresh environment:
+```shell
+uv pip install vllm --torch-backend=auto
+```
+See [its documentation](https://docs.vllm.ai/en/stable/getting_started/installation/index.html) for more details.
+
+
+The following will create API endpoints at `http://localhost:8000/v1`:
+
+- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs.
+
+ ```shell
+ vllm serve Qwen/Qwen3.6-35B-A3B --port 8000 --tensor-parallel-size 8 --max-model-len 262144 --reasoning-parser qwen3
+ ```
+
+- **Tool Call**: To support tool use, you can use the following command.
+
+ ```shell
+ vllm serve Qwen/Qwen3.6-35B-A3B --port 8000 --tensor-parallel-size 8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
+ ```
+
+- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP:
+
+ ```shell
+ vllm serve Qwen/Qwen3.6-35B-A3B --port 8000 --tensor-parallel-size 8 --max-model-len 262144 --reasoning-parser qwen3 --speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}'
+ ```
+
+- **Text-Only**: The following command skips the vision encoder and multimodal profiling to free up memory for additional KV cache:
+
+ ```shell
+ vllm serve Qwen/Qwen3.6-35B-A3B --port 8000 --tensor-parallel-size 8 --max-model-len 262144 --reasoning-parser qwen3 --language-model-only
+ ```
+
+For detailed deployment guide, see the [vLLM Qwen3.5 Recipe](https://docs.vllm.ai/projects/recipes/en/latest/Qwen/Qwen3.5.html).
+
+#### KTransformers
+
+[KTransformers](https://github.com/kvcache-ai/ktransformers) is a flexible framework for experiencing cutting-edge LLM inference optimizations with CPU-GPU heterogeneous computing.
+For running Qwen3.6 with KTransformers, see the [KTransformers Deployment Guide](https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/Qwen3.5.md).
+
+#### Hugging Face Transformers
+
+Hugging Face Transformers contains a _lightweight_ server which can be used for quick testing and moderate load deployment.
+The latest `transformers` is required for Qwen3.6:
+```shell
+pip install "transformers[serving]"
+```
+See [its documentation](https://huggingface.co/docs/transformers/main/serving) for more details. Please also make sure torchvision and pillow are installed.
+
+Then, run `transformers serve` to launch a server with API endpoints at `http://localhost:8000/v1`; it will place the model on accelerators if available:
+```shell
+transformers serve Qwen/Qwen3.6-35B-A3B --port 8000 --continuous-batching
+```
+
+### Using Qwen3.6 via the Chat Completions API
+
+The chat completions API is accessible via standard HTTP requests or OpenAI SDKs.
+Here, we show examples using the OpenAI Python SDK.
+
+Before starting, make sure it is installed and the API key and the API base URL is configured, e.g.:
+```shell
+pip install -U openai
+
+# Set the following accordingly
+export OPENAI_BASE_URL="http://localhost:8000/v1"
+export OPENAI_API_KEY="EMPTY"
+```
+
+> [!Tip]
+> We recommend using the following set of sampling parameters for generation
+> - Thinking mode for general tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0`
+> - Thinking mode for precise coding tasks (e.g. WebDev): `temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0`
+> - Instruct (or non-thinking) mode for general tasks: `temperature=0.7, top_p=0.8, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0`
+> - Instruct (or non-thinking) mode for reasoning tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0`
+>
+> Please note that the support for sampling parameters varies according to inference frameworks.
+
+> [!Important]
+> Qwen3.6 models operate in thinking mode by default, generating thinking content signified by `\n... \n\n` before producing the final responses.
+> To disable thinking content and obtain direct response, refer to the examples [here](#instruct-or-non-thinking-mode).
+
+
+#### Text-Only Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {"role": "user", "content": "Type \"I love Qwen3.6\" backwards"},
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.6-35B-A3B",
+ messages=messages,
+ max_tokens=81920,
+ temperature=1.0,
+ top_p=0.95,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ },
+)
+print("Chat response:", chat_response)
+```
+
+
+#### Image Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {
+ "type": "image_url",
+ "image_url": {
+ "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg"
+ }
+ },
+ {
+ "type": "text",
+ "text": "The centres of the four illustrated circles are in the corners of the square. The two big circles touch each other and also the two little circles. With which factor do you have to multiply the radii of the little circles to obtain the radius of the big circles?\nChoices:\n(A) $\\frac{2}{9}$\n(B) $\\sqrt{5}$\n(C) $0.8 \\cdot \\pi$\n(D) 2.5\n(E) $1+\\sqrt{2}$"
+ }
+ ]
+ }
+]
+
+response = client.chat.completions.create(
+ model="Qwen/Qwen3.6-35B-A3B",
+ messages=messages,
+ max_tokens=81920,
+ temperature=1.0,
+ top_p=0.95,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ },
+)
+print("Chat response:", chat_response)
+```
+
+#### Video Input
+
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {
+ "type": "video_url",
+ "video_url": {
+ "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4"
+ }
+ },
+ {
+ "type": "text",
+ "text": "How many porcelain jars were discovered in the niches located in the primary chamber of the tomb?"
+ }
+ ]
+ }
+]
+
+# When vLLM is launched with `--media-io-kwargs '{"video": {"num_frames": -1}}'`,
+# video frame sampling can be configured via `extra_body` (e.g., by setting `fps`).
+# This feature is currently supported only in vLLM.
+#
+# By default, `fps=2` and `do_sample_frames=True`.
+# With `do_sample_frames=True`, you can customize the `fps` value to set your desired video sampling rate.
+response = client.chat.completions.create(
+ model="Qwen/Qwen3.6-35B-A3B",
+ messages=messages,
+ max_tokens=81920,
+ temperature=1.0,
+ top_p=0.95,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True},
+ },
+)
+
+print("Chat response:", chat_response)
+```
+
+
+#### Instruct (or Non-Thinking) Mode
+
+> [!Important]
+> Qwen3.6 does not officially support the soft switch of Qwen3, i.e., `/think` and `/nothink`.
+
+Qwen3.6 will think by default before response.
+You can obtain direct response from the model without thinking by configuring the API parameters.
+For example,
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {
+ "type": "image_url",
+ "image_url": {
+ "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.6/demo/RealWorld/RealWorld-04.png"
+ }
+ },
+ {
+ "type": "text",
+ "text": "Where is this?"
+ }
+ ]
+ }
+]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.6-35B-A3B",
+ messages=messages,
+ max_tokens=32768,
+ temperature=0.7,
+ top_p=0.8,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ "chat_template_kwargs": {"enable_thinking": False},
+ },
+)
+print("Chat response:", chat_response)
+```
+
+> [!Note]
+> If you are using APIs from Alibaba Cloud Model Studio, in addition to changing `model`, please use `"enable_thinking": False` instead of `"chat_template_kwargs": {"enable_thinking": False}`.
+
+#### Preserve Thinking
+
+By default, only the thinking blocks generated in handling the latest user message is retained, resulting in a pattern commonly as interleaved thinking.
+Qwen3.6 has been additionally trained to preserve and leverage thinking traces from historical messages.
+You can enable this behavior by setting the `preserve_thinking` option:
+```python
+from openai import OpenAI
+# Configured by environment variables
+client = OpenAI()
+
+messages = [...]
+
+chat_response = client.chat.completions.create(
+ model="Qwen/Qwen3.6-35B-A3B",
+ messages=messages,
+ max_tokens=32768,
+ temperature=0.7,
+ top_p=0.8,
+ presence_penalty=1.5,
+ extra_body={
+ "top_k": 20,
+ "chat_template_kwargs": {"preserve_thinking": True},
+ },
+)
+print("Chat response:", chat_response)
+```
+
+> [!Note]
+> If you are using APIs from Alibaba Cloud Model Studio, in addition to changing `model`, please use `"preserve_thinking": True` instead of `"chat_template_kwargs": {"preserve_thinking": False}`.
+
+
+This capability is particularly beneficial for agent scenarios, where maintaining full reasoning context can enhance decision consistency and, in many cases, reduce overall token consumption by minimizing redundant reasoning. Additionally, it can improve KV cache utilization, optimizing inference efficiency in both thinking and non-thinking modes.
+
+
+## Agentic Usage
+
+Qwen3.6 excels in tool calling capabilities.
+
+### Qwen-Agent
+
+We recommend using [Qwen-Agent](https://github.com/QwenLM/Qwen-Agent) to quickly build Agent applications with Qwen3.6.
+
+To define the available tools, you can use the MCP configuration file, use the integrated tool of Qwen-Agent, or integrate other tools by yourself.
+```python
+import os
+from qwen_agent.agents import Assistant
+
+# Define LLM
+# Using Alibaba Cloud Model Studio
+llm_cfg = {
+ # Use the OpenAI-compatible model service provided by DashScope:
+ 'model': 'Qwen3.6-35B-A3B',
+ 'model_type': 'qwenvl_oai',
+ 'model_server': 'https://dashscope.aliyuncs.com/compatible-mode/v1',
+ 'api_key': os.getenv('DASHSCOPE_API_KEY'),
+
+ 'generate_cfg': {
+ 'use_raw_api': True,
+ # When using Dash Scope OAI API, pass the parameter of whether to enable thinking mode in this way
+ 'extra_body': {
+ 'enable_thinking': True,
+ 'preserve_thinking': True,
+ },
+ },
+}
+
+# Using OpenAI-compatible API endpoint.
+# functionality of the deployment frameworks and let Qwen-Agent automate the related operations.
+#
+# llm_cfg = {
+# # Use your own model service compatible with OpenAI API by vLLM/SGLang:
+# 'model': 'Qwen/Qwen3.6-35B-A3B',
+# 'model_type': 'qwenvl_oai',
+# 'model_server': 'http://localhost:8000/v1', # api_base
+# 'api_key': 'EMPTY',
+#
+# 'generate_cfg': {
+# 'use_raw_api': True,
+# # When using vLLM/SGLang OAI API, pass the parameter of whether to enable thinking mode in this way
+# 'extra_body': {
+# 'chat_template_kwargs': {'enable_thinking': True, 'preserve_thinking': True}
+# },
+# },
+# }
+
+# Define Tools
+tools = [
+ {'mcpServers': { # You can specify the MCP configuration file
+ "filesystem": {
+ "command": "npx",
+ "args": ["-y", "@modelcontextprotocol/server-filesystem", "/Users/xxxx/Desktop"]
+ }
+ }
+ }
+]
+
+# Define Agent
+bot = Assistant(llm=llm_cfg, function_list=tools)
+
+# Streaming generation
+messages = [{'role': 'user', 'content': 'Help me organize my desktop.'}]
+for responses in bot.run(messages=messages):
+ pass
+print(responses)
+
+# Streaming generation
+messages = [{'role': 'user', 'content': 'Develop a dog website and save it on the desktop'}]
+for responses in bot.run(messages=messages):
+ pass
+print(responses)
+```
+
+### Qwen Code
+
+
+[Qwen Code](https://github.com/QwenLM/qwen-code) is an open-source AI agent for the terminal, optimized for Qwen models. It helps you understand large codebases, automate tedious work, and ship faster.
+
+For more information, please refer to [Qwen Code](https://qwenlm.github.io/qwen-code-docs/).
+
+## Processing Ultra-Long Texts
+
+Qwen3.6 natively supports context lengths of up to 262,144 tokens.
+For long-horizon tasks where the total length (including both input and output) exceeds this limit, we recommend using RoPE scaling techniques to handle long texts effectively., e.g., YaRN.
+
+YaRN is currently supported by several inference frameworks, e.g., `transformers`, `vllm`, `ktransformers` and `sglang`.
+In general, there are two approaches to enabling YaRN for supported frameworks:
+
+- Modifying the model configuration file:
+ In the `config.json` file, change the `rope_parameters` fields in `text_config` to:
+ ```json
+ {
+ "mrope_interleaved": true,
+ "mrope_section": [
+ 11,
+ 11,
+ 10
+ ],
+ "rope_type": "yarn",
+ "rope_theta": 10000000,
+ "partial_rotary_factor": 0.25,
+ "factor": 4.0,
+ "original_max_position_embeddings": 262144,
+ }
+ ```
+
+- Passing command line arguments:
+
+ For `vllm`, you can use
+ ```shell
+ VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve ... --hf-overrides '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --max-model-len 1010000
+ ```
+
+ For `sglang` and `ktransformers`, you can use
+ ```shell
+ SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server ... --json-model-override-args '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --context-length 1010000
+ ```
+
+> [!NOTE]
+> All the notable open-source frameworks implement static YaRN, which means the scaling factor remains constant regardless of input length, **potentially impacting performance on shorter texts.**
+> We advise modifying the `rope_parameters` configuration only when processing long contexts is required.
+> It is also recommended to modify the `factor` as needed. For example, if the typical context length for your application is 524,288 tokens, it would be better to set `factor` as 2.0.
+
+## Best Practices
+
+To achieve optimal performance, we recommend the following settings:
+
+1. **Sampling Parameters**:
+ - We suggest using the following sets of sampling parameters depending on the mode and task type:
+ - **Thinking mode for general tasks**:
+ `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0`
+ - **Thinking mode for precise coding tasks (e.g., WebDev)**:
+ `temperature=0.6`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0`
+ - **Instruct (or non-thinking) mode for general tasks**:
+ `temperature=0.7`, `top_p=0.8`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0`
+ - **Instruct (or non-thinking) mode for reasoning tasks**:
+ `temperature=1.0`, `top_p=1.0`, `top_k=40`, `min_p=0.0`, `presence_penalty=2.0`, `repetition_penalty=1.0`
+ - For supported frameworks, you can adjust the `presence_penalty` parameter between 0 and 2 to reduce endless repetitions. However, using a higher value may occasionally result in language mixing and a slight decrease in model performance.
+
+2. **Adequate Output Length**: We recommend using an output length of 32,768 tokens for most queries. For benchmarking on highly complex problems, such as those found in math and programming competitions, we suggest setting the max output length to 81,920 tokens. This provides the model with sufficient space to generate detailed and comprehensive responses, thereby enhancing its overall performance.
+
+3. **Standardize Output Format**: We recommend using prompts to standardize model outputs when benchmarking.
+ - **Math Problems**: Include "Please reason step by step, and put your final answer within \boxed{}." in the prompt.
+ - **Multiple-Choice Questions**: Add the following JSON structure to the prompt to standardize responses: "Please show your choice in the `answer` field with only the choice letter, e.g., `"answer": "C"`."
+
+4. **Long Video Understanding**: To optimize inference efficiency for plain text and images, the `size` parameter in the released `video_preprocessor_config.json` is conservatively configured. It is recommended to set the `longest_edge` parameter in the video_preprocessor_config file to 469,762,048 (corresponding to 224k video tokens) to enable higher frame-rate sampling for hour-scale videos and thereby achieve superior performance. For example,
+ ```json
+ {"longest_edge": 469762048, "shortest_edge": 4096}
+ ```
+
+ Alternatively, override the default values via engine startup parameters. For implementation details, refer to: [vLLM](https://github.com/vllm-project/vllm/pull/34330) / [SGLang](https://github.com/sgl-project/sglang/pull/18467).
+
+
+### Citation
+
+If you find our work helpful, feel free to give us a cite.
+
+```bibtex
+@misc{qwen36_35b_a3b,
+ title = {{Qwen3.6-35B-A3B}: Agentic Coding Power, Now Open to All},
+ url = {https://qwen.ai/blog?id=qwen3.6-35b-a3b},
+ author = {{Qwen Team}},
+ month = {April},
+ year = {2026}
+}
+```
\ No newline at end of file
diff --git a/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/mmproj-F16.gguf
new file mode 100644
index 0000000..feb8852
--- /dev/null
+++ b/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/mmproj-F16.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8971ee4f331ff0a4c609374f32984b3d4e6dc086c0aa35f1d637fad1829e887f
+size 899283680
diff --git a/chat/gguf/unsloth/gemma-4-12b-it-GGUF/README.md b/chat/gguf/unsloth/gemma-4-12b-it-GGUF/README.md
new file mode 100644
index 0000000..3b275b7
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-12b-it-GGUF/README.md
@@ -0,0 +1,609 @@
+---
+license: apache-2.0
+license_link: https://ai.google.dev/gemma/docs/gemma_4_license
+pipeline_tag: image-text-to-text
+base_model: google/gemma-4-12B-it
+tags:
+- gemma4
+- unsloth
+- gemma
+- google
+- gemma4_unified
+---
+# Read our How to [Run Gemma 4 12B Guide!](https://docs.unsloth.ai/models/gemma-4)
+
+
+
+---
+
+
+
+
+
+
+
+ Hugging Face |
+ GitHub |
+ Launch Blog |
+ Documentation
+
+ License : Apache 2.0 | Authors : Google DeepMind
+
+
+> [!Note]
+> This model card is for the Gemma 4 12B Unified model, which is part of the Gemma 4 family of open models. Built with the same multimodal functionality as Gemma 4 E2B and E4B (text, audio, image, and video inputs), it brings native audio and vision understanding directly to local environments without the need for separate encoders. This unified approach to multimodality makes the model encoder-free, offering a deployment size that is perfect for consumer devices and streamlined local execution.
+
+Gemma is a family of open models built by Google DeepMind. Gemma 4 models are multimodal, handling text and image input (with audio supported on E2B, E4B, and 12B) and generating text output. This release includes open-weights models in both pre-trained and instruction-tuned variants. Gemma 4 features a context window of up to 256K tokens and maintains multilingual support in over 140 languages.
+
+Featuring both Dense and Mixture-of-Experts (MoE) architectures, Gemma 4 is well-suited for tasks like text generation, coding, and reasoning. The models are available in five distinct sizes: **E2B**, **E4B**, **12B**, **26B A4B**, and **31B**. Their diverse sizes make them deployable in environments ranging from high-end phones to laptops and servers, democratizing access to state-of-the-art AI.
+
+Gemma 4 introduces key **capability and architectural advancements**:
+
+* **Reasoning** – All models in the family are designed as highly capable reasoners, with configurable thinking modes.
+
+* **Extended Multimodalities** – Processes Text, Image with variable aspect ratio and resolution support (all models), Video, and Audio (featured natively on the E2B, E4B, and 12B models).
+
+* **Diverse & Efficient Architectures** – Offers Dense and Mixture-of-Experts (MoE) variants of different sizes for scalable deployment.
+
+* **Optimized for On-Device** – Smaller models are specifically designed for efficient local execution on laptops and mobile devices.
+
+* **Increased Context Window** – The small models feature a 128K context window, while the medium models support 256K.
+
+* **Enhanced Coding & Agentic Capabilities** – Achieves notable improvements in coding benchmarks alongside native function-calling support, powering highly capable autonomous agents.
+
+* **Native System Prompt Support** – Gemma 4 introduces native support for the `system` role, enabling more structured and controllable conversations.
+
+## **Models Overview**
+
+Gemma 4 models are designed to deliver frontier-level performance at each size, targeting deployment scenarios from mobile and edge devices (E2B, E4B) to consumer GPUs and workstations (12B, 26B A4B, 31B). They are well-suited for reasoning, agentic workflows, coding, and multimodal understanding.
+
+The models employ a hybrid attention mechanism that interleaves local sliding window attention with full global attention, ensuring the final layer is always global. This hybrid design delivers the processing speed and low memory footprint of a lightweight model without sacrificing the deep awareness required for complex, long-context tasks. To optimize memory for long contexts, global layers feature unified Keys and Values, and apply Proportional RoPE (p-RoPE).
+
+### Dense Models
+
+| Property | E2B | E4B | 12B Unified | 31B Dense |
+| :---- | :---- | :---- | :---- | :---- |
+| **Total Parameters** | 2.3B effective (5.1B with embeddings) | 4.5B effective (8B with embeddings) | 11.95B | 30.7B |
+| **Layers** | 35 | 42 | 48 | 60 |
+| **Sliding Window** | 512 tokens | 512 tokens | 1024 tokens | 1024 tokens |
+| **Context Length** | 128K tokens | 128K tokens | 256K tokens | 256K tokens |
+| **Vocabulary Size** | 262K | 262K | 262K | 262K |
+| **Supported Modalities** | Text, Image, Audio | Text, Image, Audio | Text, Image, Audio | Text, Image |
+| **Vision Encoder Parameters** | *~150M* | *~150M* | - | *~550M* |
+| **Audio Encoder Parameters** | *~300M* | *~300M* | - | No Audio |
+
+The "E" in E2B and E4B stands for "effective" parameters. The smaller models incorporate Per-Layer Embeddings (PLE) to maximize parameter efficiency in on-device deployments. Rather than adding more layers or parameters to the model, PLE gives each decoder layer its own small embedding for every token. These embedding tables are large but are only used for quick lookups, which is why the effective parameter count is much smaller than the total.
+
+The "Unified" in Gemma 4 12B Unified refers to its encoder-free architecture. Other Gemma 4 models use dedicated encoders to process multimodal data before passing it to the LLM. Gemma 4 12B eliminates these encoders entirely, projecting raw image patches and audio waveforms directly into the LLM's embedding space through lightweight linear layers. This unified approach means all modalities flow straight into a single decoder-only transformer, reducing multimodal latency and allowing the entire model to be fine-tuned in one pass.
+
+### Mixture-of-Experts (MoE) Model
+
+| Property | 26B A4B MoE |
+| :---- | :---- |
+| **Total Parameters** | 25.2B |
+| **Active Parameters** | 3.8B |
+| **Layers** | 30 |
+| **Sliding Window** | 1024 tokens |
+| **Context Length** | 256K tokens |
+| **Vocabulary Size** | 262K |
+| **Expert Count** | 8 active / 128 total and 1 shared |
+| **Supported Modalities** | Text, Image |
+| **Vision Encoder Parameters** | *~550M* |
+
+The "A" in 26B A4B stands for "active parameters" in contrast to the total number of parameters the model contains. By only activating a 4B subset of parameters during inference, the Mixture-of-Experts model runs much faster than its 26B total might suggest. This makes it an excellent choice for fast inference compared to the dense 31B model since it runs almost as fast as a 4B-parameter model.
+
+## **Benchmark Results**
+
+These models were evaluated against a large collection of different datasets and metrics to cover different aspects of text generation. Evaluation results marked in the table are for instruction-tuned models.
+
+| | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B Unified | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think) |
+| :---- | :---- | :---- | :---- | :---- | :---- | :---- |
+| MMLU Pro | 85.2% | 82.6% | 77.2% | 69.4% | 60.0% | 67.6% |
+| AIME 2026 no tools | 89.2% | 88.3% | 77.5% | 42.5% | 37.5% | 20.8% |
+| LiveCodeBench v6 | 80.0% | 77.1% | 72.0% | 52.0% | 44.0% | 29.1% |
+| Codeforces ELO | 2150 | 1718 | 1659 | 940 | 633 | 110 |
+| GPQA Diamond | 84.3% | 82.3% | 78.8% | 58.6% | 43.4% | 42.4% |
+| Tau2 (average over 3) | 76.9% | 68.2% | 69.0% | 42.2% | 24.5% | 16.2% |
+| HLE no tools | 19.5% | 8.7% | 5.2% | - | - | - |
+| HLE with search | 26.5% | 17.2% | - | - | - | - |
+| BigBench Extra Hard | 74.4% | 64.8% | 53.0% | 33.1% | 21.9% | 19.3% |
+| MMMLU | 88.4% | 86.3% | 83.4% | 76.6% | 67.4% | 70.7% |
+| **Vision** | | | | | | |
+| MMMU Pro | 76.9% | 73.8% | 69.1% | 52.6% | 44.2% | 49.7% |
+| OmniDocBench 1.5 (average edit distance, lower is better) | 0.131 | 0.149 | 0.164 | 0.181 | 0.290 | 0.365 |
+| MATH-Vision | 85.6% | 82.4% | 79.7% | 59.5% | 52.4% | 46.0% |
+| MedXPertQA MM | 61.3% | 58.1% | 48.7% | 28.7% | 23.5% | - |
+| **Audio** | | | | | | |
+| CoVoST | - | - | 38.5* | 35.54 | 33.47 | - |
+| FLEURS (lower is better) | - | - | 0.069* | 0.08 | 0.09 | - |
+| **Long Context** | | | | | | |
+| MRCR v2 8 needle 128k (average) | 66.4% | 44.1% | 43.4% | 25.4% | 19.1% | 13.5% |
+
+* Excluding Chinese language.
+
+## **Core Capabilities**
+
+Gemma 4 models handle a broad range of tasks across text, vision, and audio. Key capabilities include:
+
+* **Thinking** – Built-in reasoning mode that lets the model think step-by-step before answering.
+* **Long Context** – Context windows of up to 128K tokens (E2B/E4B) and 256K tokens (12B, 26B A4B/31B).
+* **Image Understanding** – Object detection, Document/PDF parsing, screen and UI understanding, chart comprehension, OCR (including multilingual), handwriting recognition, and pointing. Images can be processed at variable aspect ratios and resolutions.
+* **Video Understanding** – Analyze video by processing sequences of frames.
+* **Interleaved Multimodal Input** – Freely mix text and images in any order within a single prompt.
+* **Function Calling** – Native support for structured tool use, enabling agentic workflows.
+* **Coding** – Code generation, completion, and correction.
+* **Multilingual** – Out-of-the-box support for 35+ languages, pre-trained on 140+ languages.
+* **Audio** (E2B, E4B, and 12B only) – Automatic speech recognition (ASR) and speech-to-translated-text translation across multiple languages.
+
+
+## Getting Started
+
+You can use all Gemma 4 models with the latest version of Transformers. To get started, install the necessary dependencies in your environment:
+
+`pip install -U transformers torch accelerate`
+
+Once you have everything installed, you can proceed to load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-12B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output:
+
+```python
+# Prompt
+messages = [
+ {"role": "system", "content": "You are a helpful assistant."},
+ {"role": "user", "content": "Write a short joke about saving RAM."},
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+ enable_thinking=False
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=1024)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+To enable reasoning, set `enable_thinking=True` and the `parse_response` function will take care of parsing the thinking output.
+
+Below, you will also find snippets for processing audio (E2B, E4B, 12B only), images, and video alongside text:
+
+
+Code for processing Audio
+
+Make sure to install the following packages:
+
+
+`pip install -U transformers torch torchvision librosa accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-12B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the audio URL in the prompt:
+
+
+```python
+# Prompt - add audio after text
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {"type": "text", "text": "Transcribe the following speech segment in its original language. Follow these specific instructions for formatting the answer:\n* Only output the transcription, with no newlines.\n* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three."},
+ {"type": "audio", "audio": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/apps/sample-data/journal1.wav"},
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+Code for processing Images
+
+Make sure to install the following packages:
+
+
+`pip install -U transformers torch torchvision accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-12B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the image URL in the prompt:
+
+
+```python
+# Prompt - add image before text
+messages = [
+ {
+ "role": "user", "content": [
+ {"type": "image", "url": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/apps/sample-data/GoldenGate.png"},
+ {"type": "text", "text": "What is shown in this image?"}
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+
+Code for processing Videos
+
+Make sure to install the following packages:
+
+`pip install -U transformers torch torchvision librosa accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-12B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the video URL in the prompt:
+
+
+```python
+# Prompt - add video before text
+messages = [
+ {
+ 'role': 'user',
+ 'content': [
+ {"type": "video", "video": "https://github.com/bebechien/gemma/raw/refs/heads/main/videos/ForBiggerBlazes.mp4"},
+ {'type': 'text', 'text': 'Describe this video.'}
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+
+## **Best Practices**
+
+For the best performance, use these configurations and best practices:
+
+### 1. Sampling Parameters
+
+Use the following standardized sampling configuration across all use cases:
+
+* `temperature=1.0`
+* `top_p=0.95`
+* `top_k=64`
+
+### 2. Thinking Mode Configuration
+
+Compared to Gemma 3, the models use standard `system`, `assistant`, and `user` roles. To properly manage the thinking process, use the following control tokens:
+
+* **Trigger Thinking:** Thinking is enabled by including the `<|think|>` token at the start of the system prompt. To disable thinking, remove the token.
+* **Standard Generation:** When thinking is enabled, the model will output its internal reasoning followed by the final answer using this structure:
+ `<|channel>thought\n`**[Internal reasoning]**``
+* **Disabled Thinking Behavior:** For all models except for the E2B and E4B variants, if thinking is disabled, the model will still generate the tags but with an empty thought block:
+ `<|channel>thought\n`**[Final answer]**
+
+> [!Note]
+> Note that many libraries like Transformers and llama.cpp handle the complexities of the chat template for you.
+
+### 3. Multi-Turn Conversations
+
+* **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final response. Thoughts from previous model turns must *not be added* before the next user turn begins.
+
+### 4. Modality order
+
+For optimal performance with multimodal inputs, place:
+
+* Image content **before** the text in your prompt.
+* Audio content **after** the text in your prompt.
+
+### 5. Variable Image Resolution
+
+Aside from variable aspect ratios, Gemma 4 supports variable image resolution through a configurable visual token budget, which controls how many tokens are used to represent an image. A higher token budget preserves more visual detail at the cost of additional compute, while a lower budget enables faster inference for tasks that don't require fine-grained understanding.
+
+* The supported token budgets are: **70**, **140**, **280**, **560**, and **1120**.
+ * Use *lower budgets* for classification, captioning, or video understanding, where faster inference and processing many frames outweigh fine-grained detail.
+ * Use *higher budgets* for tasks like OCR, document parsing, or reading small text.
+
+### 6. Audio
+
+Use the following prompt structures for audio processing:
+
+* **Audio Speech Recognition (ASR)**
+
+```text
+Transcribe the following speech segment in {LANGUAGE} into {LANGUAGE} text.
+
+Follow these specific instructions for formatting the answer:
+* Only output the transcription, with no newlines.
+* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three.
+```
+
+* **Automatic Speech Translation (AST)**
+
+```text
+Transcribe the following speech segment in {SOURCE_LANGUAGE}, then translate it into {TARGET_LANGUAGE}.
+When formatting the answer, first output the transcription in {SOURCE_LANGUAGE}, then one newline, then output the string '{TARGET_LANGUAGE}: ', then the translation in {TARGET_LANGUAGE}.
+```
+
+### 7. Audio and Video Length
+
+All models support image inputs and can process videos as frames whereas the E2B, E4B, and 12B models also support audio inputs. Audio supports a maximum length of 30 seconds. Video supports a maximum of 60 seconds assuming the images are processed at one frame per second.
+
+## **Model Data**
+
+Data used for model training and how the data was processed.
+
+### **Training Dataset**
+
+Our pre-training dataset is a large-scale, diverse collection of data encompassing a wide range of domains and modalities, which includes web documents, code, images, audio, with a cutoff date of January 2025. Here are the key components:
+
+* **Web Documents**: A diverse collection of web text ensures the model is exposed to a broad range of linguistic styles, topics, and vocabulary. The training dataset includes content in over 140 languages.
+* **Code**: Exposing the model to code helps it to learn the syntax and patterns of programming languages, which improves its ability to generate code and understand code-related questions.
+* **Mathematics**: Training on mathematical text helps the model learn logical reasoning, symbolic representation, and to address mathematical queries.
+* **Images**: A wide range of images enables the model to perform image analysis and visual data extraction tasks.
+
+The combination of these diverse data sources is crucial for training a powerful multimodal model that can handle a wide variety of different tasks and data formats.
+
+### **Data Preprocessing**
+
+Here are the key data cleaning and filtering methods applied to the training data:
+
+* **CSAM Filtering**: Rigorous CSAM (Child Sexual Abuse Material) filtering was applied at multiple stages in the data preparation process to ensure the exclusion of harmful and illegal content.
+* **Sensitive Data Filtering**: As part of making Gemma pre-trained models safe and reliable, automated techniques were used to filter out certain personal information and other sensitive data from training sets.
+* **Additional methods**: Filtering based on content quality and safety in line with [our policies](https://ai.google/static/documents/ai-responsibility-update-published-february-2025.pdf).
+
+## **Ethics and Safety**
+
+As open models become central to enterprise infrastructure, provenance and security are paramount. Developed by Google DeepMind, Gemma 4 undergoes the same rigorous safety evaluations as our proprietary Gemini models.
+
+### **Evaluation Approach**
+
+Gemma 4 models were developed in partnership with internal safety and responsible AI teams. A range of automated as well as human evaluations were conducted to help improve model safety. These evaluations align with [Google’s AI principles](https://ai.google/principles/), as well as safety policies, which aim to prevent our generative AI models from generating harmful content, including:
+
+* Content related to child sexual abuse material and exploitation
+* Dangerous content (e.g., promoting suicide, or instructing in activities that could cause real-world harm)
+* Sexually explicit content
+* Hate speech (e.g., dehumanizing members of protected groups)
+* Harassment (e.g., encouraging violence against people)
+
+### **Evaluation Results**
+
+For all areas of safety testing, we saw major improvements in all categories of content safety relative to previous Gemma models. Overall, Gemma 4 models significantly outperform Gemma 3 and 3n models in improving safety, while keeping unjustified refusals low. All testing was conducted without safety filters to evaluate the model capabilities and behaviors. For both text-to-text and image-to-text, and across all model sizes, the model produced minimal policy violations, and showed significant improvements over previous Gemma models' performance.
+
+## **Usage and Limitations**
+
+These models have certain limitations that users should be aware of.
+
+### **Intended Usage**
+
+Multimodal models (capable of processing vision, language, and/or audio) have a wide range of applications across various industries and domains. The following list of potential uses is not comprehensive. The purpose of this list is to provide contextual information about the possible use-cases that the model creators considered as part of model training and development.
+
+* **Content Creation and Communication**
+ * **Text Generation**: These models can be used to generate creative text formats such as poems, scripts, code, marketing copy, and email drafts.
+ * **Chatbots and Conversational AI**: Power conversational interfaces for customer service, virtual assistants, or interactive applications.
+ * **Text Summarization**: Generate concise summaries of a text corpus, research papers, or reports.
+ * **Image Data Extraction**: These models can be used to extract, interpret, and summarize visual data for text communications.
+ * **Audio Processing and Interaction**: The E2B, E4B, and 12B models can analyze and interpret audio inputs, enabling voice-driven interactions and transcriptions.
+* **Research and Education**
+ * **Natural Language Processing (NLP) and VLM Research**: These models can serve as a foundation for researchers to experiment with VLM and NLP techniques, develop algorithms, and contribute to the advancement of the field.
+ * **Language Learning Tools**: Support interactive language learning experiences, aiding in grammar correction or providing writing practice.
+ * **Knowledge Exploration**: Assist researchers in exploring large bodies of text by generating summaries or answering questions about specific topics.
+
+### **Limitations**
+
+* **Training Data**
+ * The quality and diversity of the training data significantly influence the model's capabilities. Biases or gaps in the training data can lead to limitations in the model's responses.
+ * The scope of the training dataset determines the subject areas the model can handle effectively.
+* **Context and Task Complexity**
+ * Models perform well on tasks that can be framed with clear prompts and instructions. Open-ended or highly complex tasks might be challenging.
+ * A model's performance can be influenced by the amount of context provided (longer context generally leads to better outputs, up to a certain point).
+* **Language Ambiguity and Nuance**
+ * Natural language is inherently complex. Models might struggle to grasp subtle nuances, sarcasm, or figurative language.
+* **Factual Accuracy**
+ * Models generate responses based on information they learned from their training datasets, but they are not knowledge bases. They may generate incorrect or outdated factual statements.
+* **Common Sense**
+ * Models rely on statistical patterns in language. They might lack the ability to apply common sense reasoning in certain situations.
+
+### **Ethical Considerations and Risks**
+
+The development of vision-language models (VLMs) raises several ethical concerns. In creating an open model, we have carefully considered the following:
+
+* **Bias and Fairness**
+ * VLMs trained on large-scale, real-world text and image data can reflect socio-cultural biases embedded in the training material. Gemma 4 models underwent careful scrutiny, input data pre-processing, and post-training evaluations as reported in this card to help mitigate the risk of these biases.
+* **Misinformation and Misuse**
+ * VLMs can be misused to generate text that is false, misleading, or harmful.
+ * Guidelines are provided for responsible use with the model, see the [Responsible Generative AI Toolkit](https://ai.google.dev/responsible).
+* **Transparency and Accountability**
+ * This model card summarizes details on the models' architecture, capabilities, limitations, and evaluation processes.
+ * A responsibly developed open model offers the opportunity to share innovation by making VLM technology accessible to developers and researchers across the AI ecosystem.
+
+**Risks identified and mitigations**:
+
+* **Generation of harmful content**: Mechanisms and guidelines for content safety are essential. Developers are encouraged to exercise caution and implement appropriate content safety safeguards based on their specific product policies and application use cases.
+* **Misuse for malicious purposes**: Technical limitations and developer and end-user education can help mitigate against malicious applications of VLMs. Educational resources and reporting mechanisms for users to flag misuse are provided.
+* **Privacy violations**: Models were trained on data filtered for removal of certain personal information and other sensitive data. Developers are encouraged to adhere to privacy regulations with privacy-preserving techniques.
+* **Perpetuation of biases**: It's encouraged to perform continuous monitoring (using evaluation metrics, human review) and the exploration of de-biasing techniques during model training, fine-tuning, and other use cases.
+
+### **Benefits**
+
+At the time of release, this family of models provides high-performance open vision-language model implementations designed from the ground up for responsible AI development compared to similarly sized models.
+
+## Running with llama.cpp (text, vision, and audio)
+
+This is an omni GGUF, so the same files handle text, images, and audio. Grab any recent stock [llama.cpp](https://github.com/ggml-org/llama.cpp/releases) build and start the server. The multimodal projector (mmproj) is downloaded automatically when you use `-hf`, so you do not need to pass it yourself:
+
+```bash
+llama-server -hf unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL --jinja -c 8192
+# add -ngl 999 if you have a GPU build
+```
+
+Then query it through the OpenAI compatible API:
+
+```python
+import json, base64, urllib.request
+
+def ask(content, max_tokens=256):
+ body = {
+ "messages": [{"role": "user", "content": content}],
+ "max_tokens": max_tokens,
+ # Gemma 4 is a thinking model. Set this to False (or raise max_tokens),
+ # otherwise the reply lands in reasoning_content and "content" is empty.
+ "chat_template_kwargs": {"enable_thinking": False},
+ }
+ req = urllib.request.Request("http://127.0.0.1:8080/v1/chat/completions",
+ json.dumps(body).encode(),
+ {"Content-Type": "application/json"})
+ return json.loads(urllib.request.urlopen(req).read())["choices"][0]["message"]["content"]
+
+b64 = lambda p: base64.b64encode(open(p, "rb").read()).decode()
+
+# Text
+print(ask("What is 1+1?"))
+
+# Vision (any image file)
+print(ask([
+ {"type": "text", "text": "What is in this image?"},
+ {"type": "image_url", "image_url": {"url": "data:image/jpeg;base64," + b64("image.jpg")}},
+]))
+
+# Audio (16 kHz mono WAV works best)
+print(ask([
+ {"type": "text", "text": "Transcribe this audio."},
+ {"type": "input_audio", "input_audio": {"data": b64("audio.wav"), "format": "wav"}},
+]))
+```
+
+Tips:
+- Pass `--jinja` so the Gemma 4 chat template is applied.
+- For audio, feed a 16 kHz mono WAV (convert with `ffmpeg -i in.mp3 -ar 16000 -ac 1 out.wav`). Clean speech transcribes best.
+- To force a specific projector precision add `--mmproj-url .../mmproj-F16.gguf`, or pass `--no-mmproj` to disable multimodal.
diff --git a/chat/gguf/unsloth/gemma-4-12b-it-GGUF/gemma-4-12b-it-Q4_K_M.gguf b/chat/gguf/unsloth/gemma-4-12b-it-GGUF/gemma-4-12b-it-Q4_K_M.gguf
new file mode 100644
index 0000000..b9a3a6c
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-12b-it-GGUF/gemma-4-12b-it-Q4_K_M.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:43fec98c5102b1c446b4ddd0a9439f1db3a2e1f2e0b8cd143ce1ea619a9403d6
+size 7121860000
diff --git a/chat/gguf/unsloth/gemma-4-12b-it-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/gemma-4-12b-it-GGUF/mmproj-F16.gguf
new file mode 100644
index 0000000..f9b5d2a
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-12b-it-GGUF/mmproj-F16.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:91f086971e56d7a7d8d39e271873fccdb49541bd259d6e02c401a4f1cb7a219e
+size 175115840
diff --git a/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/README.md b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/README.md
new file mode 100644
index 0000000..4a9834f
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/README.md
@@ -0,0 +1,546 @@
+---
+license: apache-2.0
+license_link: https://ai.google.dev/gemma/docs/gemma_4_license
+pipeline_tag: image-text-to-text
+base_model: google/gemma-4-26B-A4B-it
+tags:
+- gemma4
+- unsloth
+- gemma
+- google
+---
+# Read our How to [Run Gemma 4 Guide!](https://docs.unsloth.ai/models/gemma-4)
+
+
+ See Unsloth Dynamic 2.0 GGUFs for our quantization benchmarks.
+
+
+
+
+ Jun 9 Update: Added MTP support. See our MTP Guide .
+ Apr 11 Update: Re-download for Google's latest chat template and llama.cpp fixes.
+ Gemma 4 can now be run and fine-tuned in Unsloth Studio . Read our guide .
+ See all versions of Gemma 4 (GGUF, 16-bit etc.) in our collection .
+ Example of Gemma 4 E4B (4-bit GGUF) running in Unsloth Studio with tool-calling:
+
+
+
+
+---
+
+
+
+
+
+
+
+ Hugging Face |
+ GitHub |
+ Launch Blog |
+ Documentation
+
+ License : Apache 2.0 | Authors : Google DeepMind
+
+
+Gemma is a family of open models built by Google DeepMind. Gemma 4 models are multimodal, handling text and image input (with audio supported on small models) and generating text output. This release includes open-weights models in both pre-trained and instruction-tuned variants. Gemma 4 features a context window of up to 256K tokens and maintains multilingual support in over 140 languages.
+
+Featuring both Dense and Mixture-of-Experts (MoE) architectures, Gemma 4 is well-suited for tasks like text generation, coding, and reasoning. The models are available in four distinct sizes: **E2B**, **E4B**, **26B A4B**, and **31B**. Their diverse sizes make them deployable in environments ranging from high-end phones to laptops and servers, democratizing access to state-of-the-art AI.
+
+Gemma 4 introduces key **capability and architectural advancements**:
+
+* **Reasoning** – All models in the family are designed as highly capable reasoners, with configurable thinking modes.
+
+* **Extended Multimodalities** – Processes Text, Image with variable aspect ratio and resolution support (all models), Video, and Audio (featured natively on the E2B and E4B models).
+
+* **Diverse & Efficient Architectures** – Offers Dense and Mixture-of-Experts (MoE) variants of different sizes for scalable deployment.
+
+* **Optimized for On-Device** – Smaller models are specifically designed for efficient local execution on laptops and mobile devices.
+
+* **Increased Context Window** – The small models feature a 128K context window, while the medium models support 256K.
+
+* **Enhanced Coding & Agentic Capabilities** – Achieves notable improvements in coding benchmarks alongside native function-calling support, powering highly capable autonomous agents.
+
+* **Native System Prompt Support** – Gemma 4 introduces native support for the `system` role, enabling more structured and controllable conversations.
+
+## **Models Overview**
+
+Gemma 4 models are designed to deliver frontier-level performance at each size, targeting deployment scenarios from mobile and edge devices (E2B, E4B) to consumer GPUs and workstations (26B A4B, 31B). They are well-suited for reasoning, agentic workflows, coding, and multimodal understanding.
+
+The models employ a hybrid attention mechanism that interleaves local sliding window attention with full global attention, ensuring the final layer is always global. This hybrid design delivers the processing speed and low memory footprint of a lightweight model without sacrificing the deep awareness required for complex, long-context tasks. To optimize memory for long contexts, global layers feature unified Keys and Values, and apply Proportional RoPE (p-RoPE).
+
+### Dense Models
+
+| Property | E2B | E4B | 31B Dense |
+| :---- | :---- | :---- | :---- |
+| **Total Parameters** | 2.3B effective (5.1B with embeddings) | 4.5B effective (8B with embeddings) | 30.7B |
+| **Layers** | 35 | 42 | 60 |
+| **Sliding Window** | 512 tokens | 512 tokens | 1024 tokens |
+| **Context Length** | 128K tokens | 128K tokens | 256K tokens |
+| **Vocabulary Size** | 262K | 262K | 262K |
+| **Supported Modalities** | Text, Image, Audio | Text, Image, Audio | Text, Image |
+| **Vision Encoder Parameters** | *~150M* | *~150M* | *~550M* |
+| **Audio Encoder Parameters** | *~300M* | *~300M* | No Audio |
+
+The "E" in E2B and E4B stands for "effective" parameters. The smaller models incorporate Per-Layer Embeddings (PLE) to maximize parameter efficiency in on-device deployments. Rather than adding more layers or parameters to the model, PLE gives each decoder layer its own small embedding for every token. These embedding tables are large but are only used for quick lookups, which is why the effective parameter count is much smaller than the total.
+
+### Mixture-of-Experts (MoE) Model
+
+| Property | 26B A4B MoE |
+| :---- | :---- |
+| **Total Parameters** | 25.2B |
+| **Active Parameters** | 3.8B |
+| **Layers** | 30 |
+| **Sliding Window** | 1024 tokens |
+| **Context Length** | 256K tokens |
+| **Vocabulary Size** | 262K |
+| **Expert Count** | 8 active / 128 total and 1 shared |
+| **Supported Modalities** | Text, Image |
+| **Vision Encoder Parameters** | *~550M* |
+
+The "A" in 26B A4B stands for "active parameters" in contrast to the total number of parameters the model contains. By only activating a 4B subset of parameters during inference, the Mixture-of-Experts model runs much faster than its 26B total might suggest. This makes it an excellent choice for fast inference compared to the dense 31B model since it runs almost as fast as a 4B-parameter model.
+
+## **Benchmark Results**
+
+These models were evaluated against a large collection of different datasets and metrics to cover different aspects of text generation. Evaluation results marked in the table are for instruction-tuned models.
+
+| | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think) |
+| :---- | :---- | :---- | :---- | :---- | :---- |
+| MMLU Pro | 85.2% | 82.6% | 69.4% | 60.0% | 67.6% |
+| AIME 2026 no tools | 89.2% | 88.3% | 42.5% | 37.5% | 20.8% |
+| LiveCodeBench v6 | 80.0% | 77.1% | 52.0% | 44.0% | 29.1% |
+| Codeforces ELO | 2150 | 1718 | 940 | 633 | 110 |
+| GPQA Diamond | 84.3% | 82.3% | 58.6% | 43.4% | 42.4% |
+| Tau2 (average over 3) | 76.9% | 68.2% | 42.2% | 24.5% | 16.2% |
+| HLE no tools | 19.5% | 8.7% | - | - | - |
+| HLE with search | 26.5% | 17.2% | - | - | - |
+| BigBench Extra Hard | 74.4% | 64.8% | 33.1% | 21.9% | 19.3% |
+| MMMLU | 88.4% | 86.3% | 76.6% | 67.4% | 70.7% |
+| **Vision** | | | | | |
+| MMMU Pro | 76.9% | 73.8% | 52.6% | 44.2% | 49.7% |
+| OmniDocBench 1.5 (average edit distance, lower is better) | 0.131 | 0.149 | 0.181 | 0.290 | 0.365 |
+| MATH-Vision | 85.6% | 82.4% | 59.5% | 52.4% | 46.0% |
+| MedXPertQA MM | 61.3% | 58.1% | 28.7% | 23.5% | - |
+| **Audio** | | | | | |
+| CoVoST | - | - | 35.54 | 33.47 | - |
+| FLEURS (lower is better) | - | - | 0.08 | 0.09 | - |
+| **Long Context** | | | | | |
+| MRCR v2 8 needle 128k (average) | 66.4% | 44.1% | 25.4% | 19.1% | 13.5% |
+
+## **Core Capabilities**
+
+Gemma 4 models handle a broad range of tasks across text, vision, and audio. Key capabilities include:
+
+* **Thinking** – Built-in reasoning mode that lets the model think step-by-step before answering.
+* **Long Context** – Context windows of up to 128K tokens (E2B/E4B) and 256K tokens (26B A4B/31B).
+* **Image Understanding** – Object detection, Document/PDF parsing, screen and UI understanding, chart comprehension, OCR (including multilingual), handwriting recognition, and pointing. Images can be processed at variable aspect ratios and resolutions.
+* **Video Understanding** – Analyze video by processing sequences of frames.
+* **Interleaved Multimodal Input** – Freely mix text and images in any order within a single prompt.
+* **Function Calling** – Native support for structured tool use, enabling agentic workflows.
+* **Coding** – Code generation, completion, and correction.
+* **Multilingual** – Out-of-the-box support for 35+ languages, pre-trained on 140+ languages.
+* **Audio** (E2B and E4B only) – Automatic speech recognition (ASR) and speech-to-translated-text translation across multiple languages.
+
+## Getting Started
+
+You can use all Gemma 4 models with the latest version of Transformers. To get started, install the necessary dependencies in your environment:
+
+`pip install -U transformers torch accelerate`
+
+Once you have everything installed, you can proceed to load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForCausalLM
+
+MODEL_ID = "google/gemma-4-26B-A4B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForCausalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output:
+
+```python
+# Prompt
+messages = [
+ {"role": "system", "content": "You are a helpful assistant."},
+ {"role": "user", "content": "Write a short joke about saving RAM."},
+]
+
+# Process input
+text = processor.apply_chat_template(
+ messages,
+ tokenize=False,
+ add_generation_prompt=True,
+ enable_thinking=False
+)
+inputs = processor(text=text, return_tensors="pt").to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=1024)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+To enable reasoning, set `enable_thinking=True` and the `parse_response` function will take care of parsing the thinking output.
+
+Below, you will also find snippets for processing audio (E2B and E4B only), images, and video alongside text:
+
+
+Code for processing Audio
+
+Instead of using `AutoModelForCausalLM`, you can use `AutoModelForMultimodalLM` to process audio. To use it, make sure to install the following packages:
+
+
+`pip install -U transformers torch librosa accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-E2B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the audio URL in the prompt:
+
+
+```python
+# Prompt - add audio before text
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {"type": "audio", "audio": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/Demos/sample-data/journal1.wav"},
+ {"type": "text", "text": "Transcribe the following speech segment in its original language. Follow these specific instructions for formatting the answer:\n* Only output the transcription, with no newlines.\n* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three."},
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+Code for processing Images
+
+Instead of using `AutoModelForCausalLM`, you can use `AutoModelForMultimodalLM` to process images. To use it, make sure to install the following packages:
+
+
+`pip install -U transformers torch torchvision accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-26B-A4B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the image URL in the prompt:
+
+
+```python
+# Prompt - add image before text
+messages = [
+ {
+ "role": "user", "content": [
+ {"type": "image", "url": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/Demos/sample-data/GoldenGate.png"},
+ {"type": "text", "text": "What is shown in this image?"}
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+
+Code for processing Videos
+
+Instead of using `AutoModelForCausalLM`, you can use `AutoModelForMultimodalLM` to process videos. To use it, make sure to install the following packages:
+
+`pip install -U transformers torch torchvision torchcodec librosa accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-26B-A4B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the video URL in the prompt:
+
+
+```python
+# Prompt - add video before text
+messages = [
+ {
+ 'role': 'user',
+ 'content': [
+ {"type": "video", "video": "https://github.com/bebechien/gemma/raw/refs/heads/main/videos/ForBiggerBlazes.mp4"},
+ {'type': 'text', 'text': 'Describe this video.'}
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+## **Best Practices**
+
+For the best performance, use these configurations and best practices:
+
+### 1. Sampling Parameters
+
+Use the following standardized sampling configuration across all use cases:
+
+* `temperature=1.0`
+* `top_p=0.95`
+* `top_k=64`
+
+### 2. Thinking Mode Configuration
+
+Compared to Gemma 3, the models use standard `system`, `assistant`, and `user` roles. To properly manage the thinking process, use the following control tokens:
+
+* **Trigger Thinking:** Thinking is enabled by including the `<|think|>` token at the start of the system prompt. To disable thinking, remove the token.
+* **Standard Generation:** When thinking is enabled, the model will output its internal reasoning followed by the final answer using this structure:
+ `<|channel>thought\n`**[Internal reasoning]**``
+* **Disabled Thinking Behavior:** For all models except for the E2B and E4B variants, if thinking is disabled, the model will still generate the tags but with an empty thought block:
+ `<|channel>thought\n`**[Final answer]**
+
+> [!Note]
+> Note that many libraries like Transformers and llama.cpp handle the complexities of the chat template for you.
+
+### 3. Multi-Turn Conversations
+
+* **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final response. Thoughts from previous model turns must *not be added* before the next user turn begins.
+
+### 4. Modality order
+
+* For optimal performance with multimodal inputs, place image and/or audio content **before** the text in your prompt.
+
+### 5. Variable Image Resolution
+
+Aside from variable aspect ratios, Gemma 4 supports variable image resolution through a configurable visual token budget, which controls how many tokens are used to represent an image. A higher token budget preserves more visual detail at the cost of additional compute, while a lower budget enables faster inference for tasks that don't require fine-grained understanding.
+
+* The supported token budgets are: **70**, **140**, **280**, **560**, and **1120**.
+ * Use *lower budgets* for classification, captioning, or video understanding, where faster inference and processing many frames outweigh fine-grained detail.
+ * Use *higher budgets* for tasks like OCR, document parsing, or reading small text.
+
+### 6. Audio
+
+Use the following prompt structures for audio processing:
+
+* **Audio Speech Recognition (ASR)**
+
+```text
+Transcribe the following speech segment in {LANGUAGE} into {LANGUAGE} text.
+
+Follow these specific instructions for formatting the answer:
+* Only output the transcription, with no newlines.
+* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three.
+```
+
+* **Automatic Speech Translation (AST)**
+
+```text
+Transcribe the following speech segment in {SOURCE_LANGUAGE}, then translate it into {TARGET_LANGUAGE}.
+When formatting the answer, first output the transcription in {SOURCE_LANGUAGE}, then one newline, then output the string '{TARGET_LANGUAGE}: ', then the translation in {TARGET_LANGUAGE}.
+```
+
+### 7. Audio and Video Length
+
+All models support image inputs and can process videos as frames whereas the E2B and E4B models also support audio inputs. Audio supports a maximum length of 30 seconds. Video supports a maximum of 60 seconds assuming the images are processed at one frame per second.
+
+## **Model Data**
+
+Data used for model training and how the data was processed.
+
+### **Training Dataset**
+
+Our pre-training dataset is a large-scale, diverse collection of data encompassing a wide range of domains and modalities, which includes web documents, code, images, audio, with a cutoff date of January 2025. Here are the key components:
+
+* **Web Documents**: A diverse collection of web text ensures the model is exposed to a broad range of linguistic styles, topics, and vocabulary. The training dataset includes content in over 140 languages.
+* **Code**: Exposing the model to code helps it to learn the syntax and patterns of programming languages, which improves its ability to generate code and understand code-related questions.
+* **Mathematics**: Training on mathematical text helps the model learn logical reasoning, symbolic representation, and to address mathematical queries.
+* **Images**: A wide range of images enables the model to perform image analysis and visual data extraction tasks.
+
+The combination of these diverse data sources is crucial for training a powerful multimodal model that can handle a wide variety of different tasks and data formats.
+
+### **Data Preprocessing**
+
+Here are the key data cleaning and filtering methods applied to the training data:
+
+* **CSAM Filtering**: Rigorous CSAM (Child Sexual Abuse Material) filtering was applied at multiple stages in the data preparation process to ensure the exclusion of harmful and illegal content.
+* **Sensitive Data Filtering**: As part of making Gemma pre-trained models safe and reliable, automated techniques were used to filter out certain personal information and other sensitive data from training sets.
+* **Additional methods**: Filtering based on content quality and safety in line with [our policies](https://ai.google/static/documents/ai-responsibility-update-published-february-2025.pdf).
+
+## **Ethics and Safety**
+
+As open models become central to enterprise infrastructure, provenance and security are paramount. Developed by Google DeepMind, Gemma 4 undergoes the same rigorous safety evaluations as our proprietary Gemini models.
+
+### **Evaluation Approach**
+
+Gemma 4 models were developed in partnership with internal safety and responsible AI teams. A range of automated as well as human evaluations were conducted to help improve model safety. These evaluations align with [Google’s AI principles](https://ai.google/principles/), as well as safety policies, which aim to prevent our generative AI models from generating harmful content, including:
+
+* Content related to child sexual abuse material and exploitation
+* Dangerous content (e.g., promoting suicide, or instructing in activities that could cause real-world harm)
+* Sexually explicit content
+* Hate speech (e.g., dehumanizing members of protected groups)
+* Harassment (e.g., encouraging violence against people)
+
+### **Evaluation Results**
+
+For all areas of safety testing, we saw major improvements in all categories of content safety relative to previous Gemma models. Overall, Gemma 4 models significantly outperform Gemma 3 and 3n models in improving safety, while keeping unjustified refusals low. All testing was conducted without safety filters to evaluate the model capabilities and behaviors. For both text-to-text and image-to-text, and across all model sizes, the model produced minimal policy violations, and showed significant improvements over previous Gemma models' performance.
+
+## **Usage and Limitations**
+
+These models have certain limitations that users should be aware of.
+
+### **Intended Usage**
+
+Multimodal models (capable of processing vision, language, and/or audio) have a wide range of applications across various industries and domains. The following list of potential uses is not comprehensive. The purpose of this list is to provide contextual information about the possible use-cases that the model creators considered as part of model training and development.
+
+* **Content Creation and Communication**
+ * **Text Generation**: These models can be used to generate creative text formats such as poems, scripts, code, marketing copy, and email drafts.
+ * **Chatbots and Conversational AI**: Power conversational interfaces for customer service, virtual assistants, or interactive applications.
+ * **Text Summarization**: Generate concise summaries of a text corpus, research papers, or reports.
+ * **Image Data Extraction**: These models can be used to extract, interpret, and summarize visual data for text communications.
+ * **Audio Processing and Interaction**: The smaller models (E2B and E4B) can analyze and interpret audio inputs, enabling voice-driven interactions and transcriptions.
+* **Research and Education**
+ * **Natural Language Processing (NLP) and VLM Research**: These models can serve as a foundation for researchers to experiment with VLM and NLP techniques, develop algorithms, and contribute to the advancement of the field.
+ * **Language Learning Tools**: Support interactive language learning experiences, aiding in grammar correction or providing writing practice.
+ * **Knowledge Exploration**: Assist researchers in exploring large bodies of text by generating summaries or answering questions about specific topics.
+
+### **Limitations**
+
+* **Training Data**
+ * The quality and diversity of the training data significantly influence the model's capabilities. Biases or gaps in the training data can lead to limitations in the model's responses.
+ * The scope of the training dataset determines the subject areas the model can handle effectively.
+* **Context and Task Complexity**
+ * Models perform well on tasks that can be framed with clear prompts and instructions. Open-ended or highly complex tasks might be challenging.
+ * A model's performance can be influenced by the amount of context provided (longer context generally leads to better outputs, up to a certain point).
+* **Language Ambiguity and Nuance**
+ * Natural language is inherently complex. Models might struggle to grasp subtle nuances, sarcasm, or figurative language.
+* **Factual Accuracy**
+ * Models generate responses based on information they learned from their training datasets, but they are not knowledge bases. They may generate incorrect or outdated factual statements.
+* **Common Sense**
+ * Models rely on statistical patterns in language. They might lack the ability to apply common sense reasoning in certain situations.
+
+### **Ethical Considerations and Risks**
+
+The development of vision-language models (VLMs) raises several ethical concerns. In creating an open model, we have carefully considered the following:
+
+* **Bias and Fairness**
+ * VLMs trained on large-scale, real-world text and image data can reflect socio-cultural biases embedded in the training material. Gemma 4 models underwent careful scrutiny, input data pre-processing, and post-training evaluations as reported in this card to help mitigate the risk of these biases.
+* **Misinformation and Misuse**
+ * VLMs can be misused to generate text that is false, misleading, or harmful.
+ * Guidelines are provided for responsible use with the model, see the [Responsible Generative AI Toolkit](https://ai.google.dev/responsible).
+* **Transparency and Accountability**
+ * This model card summarizes details on the models' architecture, capabilities, limitations, and evaluation processes.
+ * A responsibly developed open model offers the opportunity to share innovation by making VLM technology accessible to developers and researchers across the AI ecosystem.
+
+**Risks identified and mitigations**:
+
+* **Generation of harmful content**: Mechanisms and guidelines for content safety are essential. Developers are encouraged to exercise caution and implement appropriate content safety safeguards based on their specific product policies and application use cases.
+* **Misuse for malicious purposes**: Technical limitations and developer and end-user education can help mitigate against malicious applications of VLMs. Educational resources and reporting mechanisms for users to flag misuse are provided.
+* **Privacy violations**: Models were trained on data filtered for removal of certain personal information and other sensitive data. Developers are encouraged to adhere to privacy regulations with privacy-preserving techniques.
+* **Perpetuation of biases**: It's encouraged to perform continuous monitoring (using evaluation metrics, human review) and the exploration of de-biasing techniques during model training, fine-tuning, and other use cases.
+
+### **Benefits**
+
+At the time of release, this family of models provides high-performance open vision-language model implementations designed from the ground up for responsible AI development compared to similarly sized models.
diff --git a/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/config.json b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/config.json
new file mode 100644
index 0000000..4e3ad9a
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/config.json
@@ -0,0 +1,145 @@
+{
+ "architectures": [
+ "Gemma4ForConditionalGeneration"
+ ],
+ "audio_config": null,
+ "audio_token_id": 258881,
+ "boa_token_id": 256000,
+ "boi_token_id": 255999,
+ "torch_dtype": "bfloat16",
+ "eoa_token_id": 258883,
+ "eoa_token_index": 258883,
+ "eoi_token_id": 258882,
+ "eos_token_id": 106,
+ "image_token_id": 258880,
+ "initializer_range": 0.02,
+ "model_type": "gemma4",
+ "pad_token_id": 0,
+ "text_config": {
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "attention_k_eq_v": true,
+ "bos_token_id": 2,
+ "torch_dtype": "bfloat16",
+ "enable_moe_block": true,
+ "eos_token_id": 1,
+ "final_logit_softcapping": 30.0,
+ "global_head_dim": 512,
+ "head_dim": 256,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 2816,
+ "hidden_size_per_layer_input": 0,
+ "initializer_range": 0.02,
+ "intermediate_size": 2112,
+ "layer_types": [
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 262144,
+ "model_type": "gemma4_text",
+ "moe_intermediate_size": 704,
+ "num_attention_heads": 16,
+ "num_experts": 128,
+ "num_global_key_value_heads": 2,
+ "num_hidden_layers": 30,
+ "num_key_value_heads": 8,
+ "num_kv_shared_layers": 0,
+ "pad_token_id": 0,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "full_attention": {
+ "partial_rotary_factor": 0.25,
+ "rope_theta": 1000000.0,
+ "rope_type": "proportional"
+ },
+ "sliding_attention": {
+ "rope_theta": 10000.0,
+ "rope_type": "default"
+ }
+ },
+ "sliding_window": 1024,
+ "tie_word_embeddings": true,
+ "top_k_experts": 8,
+ "use_bidirectional_attention": "vision",
+ "use_cache": true,
+ "use_double_wide_mlp": false,
+ "vocab_size": 262144,
+ "vocab_size_per_layer_input": 262144
+ },
+ "tie_word_embeddings": true,
+ "transformers_version": "5.5.0.dev0",
+ "unsloth_fixed": true,
+ "video_token_id": 258884,
+ "vision_config": {
+ "_name_or_path": "",
+ "architectures": null,
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "chunk_size_feed_forward": 0,
+ "default_output_length": 280,
+ "torch_dtype": "bfloat16",
+ "global_head_dim": 72,
+ "head_dim": 72,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 1152,
+ "id2label": {
+ "0": "LABEL_0",
+ "1": "LABEL_1"
+ },
+ "initializer_range": 0.02,
+ "intermediate_size": 4304,
+ "is_encoder_decoder": false,
+ "label2id": {
+ "LABEL_0": 0,
+ "LABEL_1": 1
+ },
+ "max_position_embeddings": 131072,
+ "model_type": "gemma4_vision",
+ "num_attention_heads": 16,
+ "num_hidden_layers": 27,
+ "num_key_value_heads": 16,
+ "output_attentions": false,
+ "output_hidden_states": false,
+ "patch_size": 16,
+ "pooling_kernel_size": 3,
+ "position_embedding_size": 10240,
+ "problem_type": null,
+ "return_dict": true,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 100.0,
+ "rope_type": "default"
+ },
+ "standardize": true,
+ "use_clipped_linears": false
+ },
+ "vision_soft_tokens_per_image": 280
+}
\ No newline at end of file
diff --git a/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_M.gguf b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_M.gguf
new file mode 100644
index 0000000..bb1f42a
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_M.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:34c746b1d50ab813e29cd46c4796e3f43c741901a582f93a67b55b9fc9687b35
+size 16947539744
diff --git a/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-F16.gguf
new file mode 100644
index 0000000..2eaa43f
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-F16.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:418a6d8723067cd712235facbbc5cba6c8fbbd413fc1292d2aace5a027d5a42f
+size 1193058784
diff --git a/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/README.md b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/README.md
new file mode 100644
index 0000000..95ed566
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/README.md
@@ -0,0 +1,578 @@
+---
+library_name: transformers
+license: apache-2.0
+license_link: https://ai.google.dev/gemma/docs/gemma_4_license
+pipeline_tag: any-to-any
+base_model: google/gemma-4-E2B-it-qat-mobile-transformers
+tags:
+- gemma4
+- unsloth
+- gemma
+- google
+---
+# Read our How to [Run Gemma 4 QAT Guide!](https://unsloth.ai/docs/models/gemma-4/qat)
+
+
+
+
+
+
+## Run with MTP (speculative decoding)
+
+This model ships a Multi-Token Prediction drafter at the repo root (`mtp-gemma-4-E2B-it.gguf`, a near-lossless smart Q4_0). A recent llama.cpp auto-discovers it from `-hf`, so you do not pass `--model-draft`:
+
+```bash
+./build/bin/llama-server \
+ -hf unsloth/gemma-4-E2B-it-qat-mobile-GGUF:UD-Q2_K_XL \
+ --spec-type draft-mtp --spec-draft-n-max 4 \
+ -ngl 999 -fa on
+```
+
+The drafter shares the target's KV cache and does not change the output (the target verifies every drafted token). See the `MTP/` folder for the other precisions and explicit usage.
+
+
+
+
+
+
+
+
+ Hugging Face |
+ GitHub |
+ Launch Blog |
+ Documentation
+
+ License : Apache 2.0 | Authors : Google DeepMind
+
+
+> [!Note]
+> This model card is for the new versions of the Gemma 4 family optimized with Quantization-Aware Training (QAT), which allows preserving similar quality to bfloat16 while dramatically reducing the memory requirements to load the model.
+> Four versions of the QAT checkpoints are available:
+> * **Unquantized QAT checkpoints** (Q4_0): Half-precision weights extracted from the QAT pipeline, ideal for custom downstream compilation and research. Available for Gemma 4 E2B, E4B, 12B, 26B A4B, and 31B, and their drafter models.
+> * **GGUF** (Q4_0): Ready-to-deploy formats for broad ecosystem compatibility. Available for Gemma 4 E2B, E4B, 12B, 26B A4B, and 31B.
+> * **Mobile-optimized** (wNa8o8): A custom schema engineered explicitly for mobile hardware efficiency. It features targeted 2-bit decoding layers, optimized KV caches, and static activations to maximize VRAM savings. Available for Gemma 4 E2B and E4B.
+> * **Compressed Tensors** (w4a16): QAT checkpoints serialized in the compressed-tensors format for native, optimized inference with vLLM. Available for Gemma 4 E2B, E4B, 12B, and 31B.
+
+Gemma is a family of open models built by Google DeepMind. Gemma 4 models are multimodal, handling text and image input (with audio supported on E2B, E4B, and 12B) and generating text output. This release includes open-weights models in both pre-trained and instruction-tuned variants. Gemma 4 features a context window of up to 256K tokens and maintains multilingual support in over 140 languages.
+
+Featuring both Dense and Mixture-of-Experts (MoE) architectures, Gemma 4 is well-suited for tasks like text generation, coding, and reasoning. The models are available in five distinct sizes: **E2B**, **E4B**, **12B**, **26B A4B**, and **31B**. Their diverse sizes make them deployable in environments ranging from high-end phones to laptops and servers, democratizing access to state-of-the-art AI.
+
+Gemma 4 introduces key **capability and architectural advancements**:
+
+* **Reasoning** – All models in the family are designed as highly capable reasoners, with configurable thinking modes.
+
+* **Extended Multimodalities** – Processes Text, Image with variable aspect ratio and resolution support (all models), Video, and Audio (featured natively on the E2B, E4B, and 12B models).
+
+* **Diverse & Efficient Architectures** – Offers Dense and Mixture-of-Experts (MoE) variants of different sizes for scalable deployment.
+
+* **Optimized for On-Device** – Smaller models are specifically designed for efficient local execution on laptops and mobile devices.
+
+* **Increased Context Window** – The small models feature a 128K context window, while the medium models support 256K.
+
+* **Enhanced Coding & Agentic Capabilities** – Achieves notable improvements in coding benchmarks alongside native function-calling support, powering highly capable autonomous agents.
+
+* **Native System Prompt Support** – Gemma 4 introduces native support for the `system` role, enabling more structured and controllable conversations.
+
+## **Models Overview**
+
+Gemma 4 models are designed to deliver frontier-level performance at each size, targeting deployment scenarios from mobile and edge devices (E2B, E4B) to consumer GPUs and workstations (12B, 26B A4B, 31B). They are well-suited for reasoning, agentic workflows, coding, and multimodal understanding.
+
+The models employ a hybrid attention mechanism that interleaves local sliding window attention with full global attention, ensuring the final layer is always global. This hybrid design delivers the processing speed and low memory footprint of a lightweight model without sacrificing the deep awareness required for complex, long-context tasks. To optimize memory for long contexts, global layers feature unified Keys and Values, and apply Proportional RoPE (p-RoPE).
+
+### Dense Models
+
+| Property | E2B | E4B | 12B Unified | 31B Dense |
+| :---- | :---- | :---- | :---- | :---- |
+| **Total Parameters** | 2.3B effective (5.1B with embeddings) | 4.5B effective (8B with embeddings) | 11.95B | 30.7B |
+| **Layers** | 35 | 42 | 48 | 60 |
+| **Sliding Window** | 512 tokens | 512 tokens | 1024 tokens | 1024 tokens |
+| **Context Length** | 128K tokens | 128K tokens | 256K tokens | 256K tokens |
+| **Vocabulary Size** | 262K | 262K | 262K | 262K |
+| **Supported Modalities** | Text, Image, Audio | Text, Image, Audio | Text, Image, Audio | Text, Image |
+| **Vision Encoder Parameters** | *~150M* | *~150M* | - | *~550M* |
+| **Audio Encoder Parameters** | *~300M* | *~300M* | - | No Audio |
+
+The "E" in E2B and E4B stands for "effective" parameters. The smaller models incorporate Per-Layer Embeddings (PLE) to maximize parameter efficiency in on-device deployments. Rather than adding more layers or parameters to the model, PLE gives each decoder layer its own small embedding for every token. These embedding tables are large but are only used for quick lookups, which is why the effective parameter count is much smaller than the total.
+
+The "Unified" in Gemma 4 12B Unified refers to its encoder-free architecture. Other Gemma 4 models use dedicated encoders to process multimodal data before passing it to the LLM. Gemma 4 12B eliminates these encoders entirely, projecting raw image patches and audio waveforms directly into the LLM's embedding space through lightweight linear layers. This unified approach means all modalities flow straight into a single decoder-only transformer, reducing multimodal latency and allowing the entire model to be fine-tuned in one pass.
+
+### Mixture-of-Experts (MoE) Model
+
+| Property | 26B A4B MoE |
+| :---- | :---- |
+| **Total Parameters** | 25.2B |
+| **Active Parameters** | 3.8B |
+| **Layers** | 30 |
+| **Sliding Window** | 1024 tokens |
+| **Context Length** | 256K tokens |
+| **Vocabulary Size** | 262K |
+| **Expert Count** | 8 active / 128 total and 1 shared |
+| **Supported Modalities** | Text, Image |
+| **Vision Encoder Parameters** | *~550M* |
+
+The "A" in 26B A4B stands for "active parameters" in contrast to the total number of parameters the model contains. By only activating a 4B subset of parameters during inference, the Mixture-of-Experts model runs much faster than its 26B total might suggest. This makes it an excellent choice for fast inference compared to the dense 31B model since it runs almost as fast as a 4B-parameter model.
+
+## **Benchmark Results**
+
+These models were evaluated against a large collection of different datasets and metrics to cover different aspects of text generation. Evaluation results marked in the table are for instruction-tuned models.
+
+| | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B Unified | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think) |
+| :---- | :---- | :---- | :---- | :---- | :---- | :---- |
+| MMLU Pro | 85.2% | 82.6% | 77.2% | 69.4% | 60.0% | 67.6% |
+| AIME 2026 no tools | 89.2% | 88.3% | 77.5% | 42.5% | 37.5% | 20.8% |
+| LiveCodeBench v6 | 80.0% | 77.1% | 72.0% | 52.0% | 44.0% | 29.1% |
+| Codeforces ELO | 2150 | 1718 | 1659 | 940 | 633 | 110 |
+| GPQA Diamond | 84.3% | 82.3% | 78.8% | 58.6% | 43.4% | 42.4% |
+| Tau2 (average over 3) | 76.9% | 68.2% | 69.0% | 42.2% | 24.5% | 16.2% |
+| HLE no tools | 19.5% | 8.7% | 5.2% | - | - | - |
+| HLE with search | 26.5% | 17.2% | - | - | - | - |
+| BigBench Extra Hard | 74.4% | 64.8% | 53.0% | 33.1% | 21.9% | 19.3% |
+| MMMLU | 88.4% | 86.3% | 83.4% | 76.6% | 67.4% | 70.7% |
+| **Vision** | | | | | | |
+| MMMU Pro | 76.9% | 73.8% | 69.1% | 52.6% | 44.2% | 49.7% |
+| OmniDocBench 1.5 (average edit distance, lower is better) | 0.131 | 0.149 | 0.164 | 0.181 | 0.290 | 0.365 |
+| MATH-Vision | 85.6% | 82.4% | 79.7% | 59.5% | 52.4% | 46.0% |
+| MedXPertQA MM | 61.3% | 58.1% | 48.7% | 28.7% | 23.5% | - |
+| **Audio** | | | | | | |
+| CoVoST | - | - | 38.5* | 35.54 | 33.47 | - |
+| FLEURS (lower is better) | - | - | 0.069* | 0.08 | 0.09 | - |
+| **Long Context** | | | | | | |
+| MRCR v2 8 needle 128k (average) | 66.4% | 44.1% | 43.4% | 25.4% | 19.1% | 13.5% |
+
+* Excluding Chinese language.
+
+## **Core Capabilities**
+
+Gemma 4 models handle a broad range of tasks across text, vision, and audio. Key capabilities include:
+
+* **Thinking** – Built-in reasoning mode that lets the model think step-by-step before answering.
+* **Long Context** – Context windows of up to 128K tokens (E2B/E4B) and 256K tokens (12B, 26B A4B/31B).
+* **Image Understanding** – Object detection, Document/PDF parsing, screen and UI understanding, chart comprehension, OCR (including multilingual), handwriting recognition, and pointing. Images can be processed at variable aspect ratios and resolutions.
+* **Video Understanding** – Analyze video by processing sequences of frames.
+* **Interleaved Multimodal Input** – Freely mix text and images in any order within a single prompt.
+* **Function Calling** – Native support for structured tool use, enabling agentic workflows.
+* **Coding** – Code generation, completion, and correction.
+* **Multilingual** – Out-of-the-box support for 35+ languages, pre-trained on 140+ languages.
+* **Audio** (E2B, E4B, and 12B only) – Automatic speech recognition (ASR) and speech-to-translated-text translation across multiple languages.
+
+
+## Getting Started
+
+You can use all Gemma 4 models with the latest version of Transformers. To get started, install the necessary dependencies in your environment:
+
+`pip install -U transformers torch accelerate`
+
+Once you have everything installed, you can proceed to load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-12B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output:
+
+```python
+# Prompt
+messages = [
+ {"role": "system", "content": "You are a helpful assistant."},
+ {"role": "user", "content": "Write a short joke about saving RAM."},
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+ enable_thinking=False
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=1024)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+To enable reasoning, set `enable_thinking=True` and the `parse_response` function will take care of parsing the thinking output.
+
+Below, you will also find snippets for processing audio (E2B, E4B, 12B only), images, and video alongside text:
+
+
+Code for processing Audio
+
+Make sure to install the following packages:
+
+`pip install -U transformers torch torchvision librosa accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-12B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the audio URL in the prompt:
+
+
+```python
+# Prompt - add audio after text
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {"type": "text", "text": "Transcribe the following speech segment in its original language. Follow these specific instructions for formatting the answer:\n* Only output the transcription, with no newlines.\n* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three."},
+ {"type": "audio", "audio": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/apps/sample-data/journal1.wav"},
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+Code for processing Images
+
+Make sure to install the following packages:
+
+
+`pip install -U transformers torch torchvision accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-12B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the image URL in the prompt:
+
+
+```python
+# Prompt - add image before text
+messages = [
+ {
+ "role": "user", "content": [
+ {"type": "image", "url": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/apps/sample-data/GoldenGate.png"},
+ {"type": "text", "text": "What is shown in this image?"}
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+
+Code for processing Videos
+
+Make sure to install the following packages:
+
+`pip install -U transformers torch torchvision librosa accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-12B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the video URL in the prompt:
+
+
+```python
+# Prompt - add video before text
+messages = [
+ {
+ 'role': 'user',
+ 'content': [
+ {"type": "video", "video": "https://github.com/bebechien/gemma/raw/refs/heads/main/videos/ForBiggerBlazes.mp4"},
+ {'type': 'text', 'text': 'Describe this video.'}
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+
+## **Best Practices**
+
+For the best performance, use these configurations and best practices:
+
+### 1. Sampling Parameters
+
+Use the following standardized sampling configuration across all use cases:
+
+* `temperature=1.0`
+* `top_p=0.95`
+* `top_k=64`
+
+### 2. Thinking Mode Configuration
+
+Compared to Gemma 3, the models use standard `system`, `assistant`, and `user` roles. To properly manage the thinking process, use the following control tokens:
+
+* **Trigger Thinking:** Thinking is enabled by including the `<|think|>` token at the start of the system prompt. To disable thinking, remove the token.
+* **Standard Generation:** When thinking is enabled, the model will output its internal reasoning followed by the final answer using this structure:
+ `<|channel>thought\n`**[Internal reasoning]**``
+* **Disabled Thinking Behavior:** For all models except for the E2B and E4B variants, if thinking is disabled, the model will still generate the tags but with an empty thought block:
+ `<|channel>thought\n`**[Final answer]**
+
+> [!Note]
+> Note that many libraries like Transformers and llama.cpp handle the complexities of the chat template for you.
+
+### 3. Multi-Turn Conversations
+
+* **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final response. Thoughts from previous model turns must *not be added* before the next user turn begins.
+
+### 4. Modality order
+
+For optimal performance with multimodal inputs, place:
+
+* Image content **before** the text in your prompt.
+* Audio content **after** the text in your prompt.
+
+### 5. Variable Image Resolution
+
+Aside from variable aspect ratios, Gemma 4 supports variable image resolution through a configurable visual token budget, which controls how many tokens are used to represent an image. A higher token budget preserves more visual detail at the cost of additional compute, while a lower budget enables faster inference for tasks that don't require fine-grained understanding.
+
+* The supported token budgets are: **70**, **140**, **280**, **560**, and **1120**.
+ * Use *lower budgets* for classification, captioning, or video understanding, where faster inference and processing many frames outweigh fine-grained detail.
+ * Use *higher budgets* for tasks like OCR, document parsing, or reading small text.
+
+### 6. Audio
+
+Use the following prompt structures for audio processing:
+
+* **Audio Speech Recognition (ASR)**
+
+```text
+Transcribe the following speech segment in {LANGUAGE} into {LANGUAGE} text.
+
+Follow these specific instructions for formatting the answer:
+* Only output the transcription, with no newlines.
+* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three.
+```
+
+* **Automatic Speech Translation (AST)**
+
+```text
+Transcribe the following speech segment in {SOURCE_LANGUAGE}, then translate it into {TARGET_LANGUAGE}.
+When formatting the answer, first output the transcription in {SOURCE_LANGUAGE}, then one newline, then output the string '{TARGET_LANGUAGE}: ', then the translation in {TARGET_LANGUAGE}.
+```
+
+### 7. Audio and Video Length
+
+All models support image inputs and can process videos as frames whereas the E2B, E4B, and 12B models also support audio inputs. Audio supports a maximum length of 30 seconds. Video supports a maximum of 60 seconds assuming the images are processed at one frame per second.
+
+## **Model Data**
+
+Data used for model training and how the data was processed.
+
+### **Training Dataset**
+
+Our pre-training dataset is a large-scale, diverse collection of data encompassing a wide range of domains and modalities, which includes web documents, code, images, audio, with a cutoff date of January 2025. Here are the key components:
+
+* **Web Documents**: A diverse collection of web text ensures the model is exposed to a broad range of linguistic styles, topics, and vocabulary. The training dataset includes content in over 140 languages.
+* **Code**: Exposing the model to code helps it to learn the syntax and patterns of programming languages, which improves its ability to generate code and understand code-related questions.
+* **Mathematics**: Training on mathematical text helps the model learn logical reasoning, symbolic representation, and to address mathematical queries.
+* **Images**: A wide range of images enables the model to perform image analysis and visual data extraction tasks.
+
+The combination of these diverse data sources is crucial for training a powerful multimodal model that can handle a wide variety of different tasks and data formats.
+
+### **Data Preprocessing**
+
+Here are the key data cleaning and filtering methods applied to the training data:
+
+* **CSAM Filtering**: Rigorous CSAM (Child Sexual Abuse Material) filtering was applied at multiple stages in the data preparation process to ensure the exclusion of harmful and illegal content.
+* **Sensitive Data Filtering**: As part of making Gemma pre-trained models safe and reliable, automated techniques were used to filter out certain personal information and other sensitive data from training sets.
+* **Additional methods**: Filtering based on content quality and safety in line with [our policies](https://ai.google/static/documents/ai-responsibility-update-published-february-2025.pdf).
+
+## **Ethics and Safety**
+
+As open models become central to enterprise infrastructure, provenance and security are paramount. Developed by Google DeepMind, Gemma 4 undergoes the same rigorous safety evaluations as our proprietary Gemini models.
+
+### **Evaluation Approach**
+
+Gemma 4 models were developed in partnership with internal safety and responsible AI teams. A range of automated as well as human evaluations were conducted to help improve model safety. These evaluations align with [Google’s AI principles](https://ai.google/principles/), as well as safety policies, which aim to prevent our generative AI models from generating harmful content, including:
+
+* Content related to child sexual abuse material and exploitation
+* Dangerous content (e.g., promoting suicide, or instructing in activities that could cause real-world harm)
+* Sexually explicit content
+* Hate speech (e.g., dehumanizing members of protected groups)
+* Harassment (e.g., encouraging violence against people)
+
+### **Evaluation Results**
+
+For all areas of safety testing, we saw major improvements in all categories of content safety relative to previous Gemma models. Overall, Gemma 4 models significantly outperform Gemma 3 and 3n models in improving safety, while keeping unjustified refusals low. All testing was conducted without safety filters to evaluate the model capabilities and behaviors. For both text-to-text and image-to-text, and across all model sizes, the model produced minimal policy violations, and showed significant improvements over previous Gemma models' performance.
+
+## **Usage and Limitations**
+
+These models have certain limitations that users should be aware of.
+
+### **Intended Usage**
+
+Multimodal models (capable of processing vision, language, and/or audio) have a wide range of applications across various industries and domains. The following list of potential uses is not comprehensive. The purpose of this list is to provide contextual information about the possible use-cases that the model creators considered as part of model training and development.
+
+* **Content Creation and Communication**
+ * **Text Generation**: These models can be used to generate creative text formats such as poems, scripts, code, marketing copy, and email drafts.
+ * **Chatbots and Conversational AI**: Power conversational interfaces for customer service, virtual assistants, or interactive applications.
+ * **Text Summarization**: Generate concise summaries of a text corpus, research papers, or reports.
+ * **Image Data Extraction**: These models can be used to extract, interpret, and summarize visual data for text communications.
+ * **Audio Processing and Interaction**: The E2B, E4B, and 12B models can analyze and interpret audio inputs, enabling voice-driven interactions and transcriptions.
+* **Research and Education**
+ * **Natural Language Processing (NLP) and VLM Research**: These models can serve as a foundation for researchers to experiment with VLM and NLP techniques, develop algorithms, and contribute to the advancement of the field.
+ * **Language Learning Tools**: Support interactive language learning experiences, aiding in grammar correction or providing writing practice.
+ * **Knowledge Exploration**: Assist researchers in exploring large bodies of text by generating summaries or answering questions about specific topics.
+
+### **Limitations**
+
+* **Training Data**
+ * The quality and diversity of the training data significantly influence the model's capabilities. Biases or gaps in the training data can lead to limitations in the model's responses.
+ * The scope of the training dataset determines the subject areas the model can handle effectively.
+* **Context and Task Complexity**
+ * Models perform well on tasks that can be framed with clear prompts and instructions. Open-ended or highly complex tasks might be challenging.
+ * A model's performance can be influenced by the amount of context provided (longer context generally leads to better outputs, up to a certain point).
+* **Language Ambiguity and Nuance**
+ * Natural language is inherently complex. Models might struggle to grasp subtle nuances, sarcasm, or figurative language.
+* **Factual Accuracy**
+ * Models generate responses based on information they learned from their training datasets, but they are not knowledge bases. They may generate incorrect or outdated factual statements.
+* **Common Sense**
+ * Models rely on statistical patterns in language. They might lack the ability to apply common sense reasoning in certain situations.
+
+### **Ethical Considerations and Risks**
+
+The development of vision-language models (VLMs) raises several ethical concerns. In creating an open model, we have carefully considered the following:
+
+* **Bias and Fairness**
+ * VLMs trained on large-scale, real-world text and image data can reflect socio-cultural biases embedded in the training material. Gemma 4 models underwent careful scrutiny, input data pre-processing, and post-training evaluations as reported in this card to help mitigate the risk of these biases.
+* **Misinformation and Misuse**
+ * VLMs can be misused to generate text that is false, misleading, or harmful.
+ * Guidelines are provided for responsible use with the model, see the [Responsible Generative AI Toolkit](https://ai.google.dev/responsible).
+* **Transparency and Accountability**
+ * This model card summarizes details on the models' architecture, capabilities, limitations, and evaluation processes.
+ * A responsibly developed open model offers the opportunity to share innovation by making VLM technology accessible to developers and researchers across the AI ecosystem.
+
+**Risks identified and mitigations**:
+
+* **Generation of harmful content**: Mechanisms and guidelines for content safety are essential. Developers are encouraged to exercise caution and implement appropriate content safety safeguards based on their specific product policies and application use cases.
+* **Misuse for malicious purposes**: Technical limitations and developer and end-user education can help mitigate against malicious applications of VLMs. Educational resources and reporting mechanisms for users to flag misuse are provided.
+* **Privacy violations**: Models were trained on data filtered for removal of certain personal information and other sensitive data. Developers are encouraged to adhere to privacy regulations with privacy-preserving techniques.
+* **Perpetuation of biases**: It's encouraged to perform continuous monitoring (using evaluation metrics, human review) and the exploration of de-biasing techniques during model training, fine-tuning, and other use cases.
+
+### **Benefits**
+
+At the time of release, this family of models provides high-performance open vision-language model implementations designed from the ground up for responsible AI development compared to similarly sized models.
\ No newline at end of file
diff --git a/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/config.json b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/config.json
new file mode 100644
index 0000000..df45a92
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/config.json
@@ -0,0 +1,190 @@
+{
+ "architectures": [
+ "Gemma4ForConditionalGeneration"
+ ],
+ "audio_config": {
+ "_name_or_path": "",
+ "architectures": null,
+ "attention_chunk_size": 12,
+ "attention_context_left": 13,
+ "attention_context_right": 0,
+ "attention_invalid_logits_value": -1000000000.0,
+ "attention_logit_cap": 50.0,
+ "chunk_size_feed_forward": 0,
+ "conv_kernel_size": 5,
+ "torch_dtype": "bfloat16",
+ "gradient_clipping": 10000000000.0,
+ "hidden_act": "silu",
+ "hidden_size": 1024,
+ "id2label": {
+ "0": "LABEL_0",
+ "1": "LABEL_1"
+ },
+ "initializer_range": 0.02,
+ "is_encoder_decoder": false,
+ "label2id": {
+ "LABEL_0": 0,
+ "LABEL_1": 1
+ },
+ "model_type": "gemma4_audio",
+ "num_attention_heads": 8,
+ "num_hidden_layers": 12,
+ "output_attentions": false,
+ "output_hidden_states": false,
+ "output_proj_dims": 1536,
+ "problem_type": null,
+ "residual_weight": 0.5,
+ "return_dict": true,
+ "rms_norm_eps": 1e-06,
+ "subsampling_conv_channels": [
+ 128,
+ 32
+ ],
+ "use_clipped_linears": true
+ },
+ "audio_token_id": 258881,
+ "boa_token_id": 256000,
+ "boi_token_id": 255999,
+ "torch_dtype": "bfloat16",
+ "eoa_token_id": 258883,
+ "eoa_token_index": 258883,
+ "eoi_token_id": 258882,
+ "eos_token_id": 106,
+ "image_token_id": 258880,
+ "initializer_range": 0.02,
+ "model_type": "gemma4",
+ "pad_token_id": 0,
+ "text_config": {
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "attention_k_eq_v": false,
+ "bos_token_id": 2,
+ "torch_dtype": "bfloat16",
+ "enable_moe_block": false,
+ "eos_token_id": 1,
+ "expert_intermediate_size": null,
+ "final_logit_softcapping": 30.0,
+ "global_head_dim": 512,
+ "head_dim": 256,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 1536,
+ "hidden_size_per_layer_input": 256,
+ "initializer_range": 0.02,
+ "intermediate_size": 6144,
+ "layer_types": [
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 131072,
+ "model_type": "gemma4_text",
+ "moe_intermediate_size": null,
+ "num_attention_heads": 8,
+ "num_experts": null,
+ "num_global_key_value_heads": null,
+ "num_hidden_layers": 35,
+ "num_key_value_heads": 1,
+ "num_kv_shared_layers": 20,
+ "pad_token_id": 0,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "full_attention": {
+ "partial_rotary_factor": 0.25,
+ "rope_theta": 1000000.0,
+ "rope_type": "proportional"
+ },
+ "sliding_attention": {
+ "rope_theta": 10000.0,
+ "rope_type": "default"
+ }
+ },
+ "sliding_window": 512,
+ "tie_word_embeddings": true,
+ "top_k_experts": null,
+ "use_bidirectional_attention": null,
+ "use_cache": true,
+ "use_double_wide_mlp": true,
+ "vocab_size": 262144,
+ "vocab_size_per_layer_input": 262144
+ },
+ "tie_word_embeddings": true,
+ "transformers_version": "5.5.0.dev0",
+ "unsloth_fixed": true,
+ "video_token_id": 258884,
+ "vision_config": {
+ "_name_or_path": "",
+ "architectures": null,
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "chunk_size_feed_forward": 0,
+ "default_output_length": 280,
+ "torch_dtype": "bfloat16",
+ "global_head_dim": 64,
+ "head_dim": 64,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 768,
+ "id2label": {
+ "0": "LABEL_0",
+ "1": "LABEL_1"
+ },
+ "initializer_range": 0.02,
+ "intermediate_size": 3072,
+ "is_encoder_decoder": false,
+ "label2id": {
+ "LABEL_0": 0,
+ "LABEL_1": 1
+ },
+ "max_position_embeddings": 131072,
+ "model_type": "gemma4_vision",
+ "num_attention_heads": 12,
+ "num_hidden_layers": 16,
+ "num_key_value_heads": 12,
+ "output_attentions": false,
+ "output_hidden_states": false,
+ "patch_size": 16,
+ "pooling_kernel_size": 3,
+ "position_embedding_size": 10240,
+ "problem_type": null,
+ "return_dict": true,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 100.0,
+ "rope_type": "default"
+ },
+ "standardize": false,
+ "use_clipped_linears": true
+ },
+ "vision_soft_tokens_per_image": 280
+}
\ No newline at end of file
diff --git a/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/gemma-4-E2B-it-qat-UD-Q2_K_XL.gguf b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/gemma-4-E2B-it-qat-UD-Q2_K_XL.gguf
new file mode 100644
index 0000000..73017be
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/gemma-4-E2B-it-qat-UD-Q2_K_XL.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8279c8b153490e400831e89fc8162348911dfbe3c70d22055c70abaa9b05a0b4
+size 2186184768
diff --git a/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/mmproj-F16.gguf
new file mode 100644
index 0000000..8967093
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/mmproj-F16.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:13c8966d1635d02e6727f27402880614906fa291850c07feda18dbcddf2291b6
+size 985654080
diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/README.md b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/README.md
new file mode 100644
index 0000000..70091cc
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/README.md
@@ -0,0 +1,548 @@
+---
+license: apache-2.0
+license_link: https://ai.google.dev/gemma/docs/gemma_4_license
+pipeline_tag: image-text-to-text
+base_model: google/gemma-4-E4B-it
+tags:
+- gemma4
+- unsloth
+- gemma
+- google
+---
+# Read our How to [Run Gemma 4 Guide!](https://docs.unsloth.ai/models/gemma-4)
+
+
+ See Unsloth Dynamic 2.0 GGUFs for our quantization benchmarks.
+
+
+
+
+ Jun 9 Update: Added MTP support. See our MTP Guide .
+ Apr 11 Update: Re-download for Google's latest chat template and llama.cpp fixes.
+ Gemma 4 can now be run and fine-tuned in Unsloth Studio . Read our guide .
+ See all versions of Gemma 4 (GGUF, 16-bit etc.) in our collection .
+ Example of Gemma 4 E4B (4-bit GGUF) running in Unsloth Studio with tool-calling:
+
+
+
+
+---
+
+
+
+
+
+
+
+ Hugging Face |
+ GitHub |
+ Launch Blog |
+ Documentation
+
+ License : Apache 2.0 | Authors : Google DeepMind
+
+
+Gemma is a family of open models built by Google DeepMind. Gemma 4 models are multimodal, handling text and image input (with audio supported on small models) and generating text output. This release includes open-weights models in both pre-trained and instruction-tuned variants. Gemma 4 features a context window of up to 256K tokens and maintains multilingual support in over 140 languages.
+
+Featuring both Dense and Mixture-of-Experts (MoE) architectures, Gemma 4 is well-suited for tasks like text generation, coding, and reasoning. The models are available in four distinct sizes: **E2B**, **E4B**, **26B A4B**, and **31B**. Their diverse sizes make them deployable in environments ranging from high-end phones to laptops and servers, democratizing access to state-of-the-art AI.
+
+Gemma 4 introduces key **capability and architectural advancements**:
+
+* **Reasoning** – All models in the family are designed as highly capable reasoners, with configurable thinking modes.
+
+* **Extended Multimodalities** – Processes Text, Image with variable aspect ratio and resolution support (all models), Video, and Audio (featured natively on the E2B and E4B models).
+
+* **Diverse & Efficient Architectures** – Offers Dense and Mixture-of-Experts (MoE) variants of different sizes for scalable deployment.
+
+* **Optimized for On-Device** – Smaller models are specifically designed for efficient local execution on laptops and mobile devices.
+
+* **Increased Context Window** – The small models feature a 128K context window, while the medium models support 256K.
+
+* **Enhanced Coding & Agentic Capabilities** – Achieves notable improvements in coding benchmarks alongside native function-calling support, powering highly capable autonomous agents.
+
+* **Native System Prompt Support** – Gemma 4 introduces native support for the `system` role, enabling more structured and controllable conversations.
+
+## **Models Overview**
+
+Gemma 4 models are designed to deliver frontier-level performance at each size, targeting deployment scenarios from mobile and edge devices (E2B, E4B) to consumer GPUs and workstations (26B A4B, 31B). They are well-suited for reasoning, agentic workflows, coding, and multimodal understanding.
+
+The models employ a hybrid attention mechanism that interleaves local sliding window attention with full global attention, ensuring the final layer is always global. This hybrid design delivers the processing speed and low memory footprint of a lightweight model without sacrificing the deep awareness required for complex, long-context tasks. To optimize memory for long contexts, global layers feature unified Keys and Values, and apply Proportional RoPE (p-RoPE).
+
+### Dense Models
+
+| Property | E2B | E4B | 31B Dense |
+| :---- | :---- | :---- | :---- |
+| **Total Parameters** | 2.3B effective (5.1B with embeddings) | 4.5B effective (8B with embeddings) | 30.7B |
+| **Layers** | 35 | 42 | 60 |
+| **Sliding Window** | 512 tokens | 512 tokens | 1024 tokens |
+| **Context Length** | 128K tokens | 128K tokens | 256K tokens |
+| **Vocabulary Size** | 262K | 262K | 262K |
+| **Supported Modalities** | Text, Image, Audio | Text, Image, Audio | Text, Image |
+| **Vision Encoder Parameters** | *~150M* | *~150M* | *~550M* |
+| **Audio Encoder Parameters** | *~300M* | *~300M* | No Audio |
+
+The "E" in E2B and E4B stands for "effective" parameters. The smaller models incorporate Per-Layer Embeddings (PLE) to maximize parameter efficiency in on-device deployments. Rather than adding more layers or parameters to the model, PLE gives each decoder layer its own small embedding for every token. These embedding tables are large but are only used for quick lookups, which is why the effective parameter count is much smaller than the total.
+
+### Mixture-of-Experts (MoE) Model
+
+| Property | 26B A4B MoE |
+| :---- | :---- |
+| **Total Parameters** | 25.2B |
+| **Active Parameters** | 3.8B |
+| **Layers** | 30 |
+| **Sliding Window** | 1024 tokens |
+| **Context Length** | 256K tokens |
+| **Vocabulary Size** | 262K |
+| **Expert Count** | 8 active / 128 total and 1 shared |
+| **Supported Modalities** | Text, Image |
+| **Vision Encoder Parameters** | *~550M* |
+
+The "A" in 26B A4B stands for "active parameters" in contrast to the total number of parameters the model contains. By only activating a 4B subset of parameters during inference, the Mixture-of-Experts model runs much faster than its 26B total might suggest. This makes it an excellent choice for fast inference compared to the dense 31B model since it runs almost as fast as a 4B-parameter model.
+
+## **Benchmark Results**
+
+These models were evaluated against a large collection of different datasets and metrics to cover different aspects of text generation. Evaluation results marked in the table are for instruction-tuned models.
+
+| | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think) |
+| :---- | :---- | :---- | :---- | :---- | :---- |
+| MMLU Pro | 85.2% | 82.6% | 69.4% | 60.0% | 67.6% |
+| AIME 2026 no tools | 89.2% | 88.3% | 42.5% | 37.5% | 20.8% |
+| LiveCodeBench v6 | 80.0% | 77.1% | 52.0% | 44.0% | 29.1% |
+| Codeforces ELO | 2150 | 1718 | 940 | 633 | 110 |
+| GPQA Diamond | 84.3% | 82.3% | 58.6% | 43.4% | 42.4% |
+| Tau2 (average over 3) | 76.9% | 68.2% | 42.2% | 24.5% | 16.2% |
+| HLE no tools | 19.5% | 8.7% | - | - | - |
+| HLE with search | 26.5% | 17.2% | - | - | - |
+| BigBench Extra Hard | 74.4% | 64.8% | 33.1% | 21.9% | 19.3% |
+| MMMLU | 88.4% | 86.3% | 76.6% | 67.4% | 70.7% |
+| **Vision** | | | | | |
+| MMMU Pro | 76.9% | 73.8% | 52.6% | 44.2% | 49.7% |
+| OmniDocBench 1.5 (average edit distance, lower is better) | 0.131 | 0.149 | 0.181 | 0.290 | 0.365 |
+| MATH-Vision | 85.6% | 82.4% | 59.5% | 52.4% | 46.0% |
+| MedXPertQA MM | 61.3% | 58.1% | 28.7% | 23.5% | - |
+| **Audio** | | | | | |
+| CoVoST | - | - | 35.54 | 33.47 | - |
+| FLEURS (lower is better) | - | - | 0.08 | 0.09 | - |
+| **Long Context** | | | | | |
+| MRCR v2 8 needle 128k (average) | 66.4% | 44.1% | 25.4% | 19.1% | 13.5% |
+
+## **Core Capabilities**
+
+Gemma 4 models handle a broad range of tasks across text, vision, and audio. Key capabilities include:
+
+* **Thinking** – Built-in reasoning mode that lets the model think step-by-step before answering.
+* **Long Context** – Context windows of up to 128K tokens (E2B/E4B) and 256K tokens (26B A4B/31B).
+* **Image Understanding** – Object detection, Document/PDF parsing, screen and UI understanding, chart comprehension, OCR (including multilingual), handwriting recognition, and pointing. Images can be processed at variable aspect ratios and resolutions.
+* **Video Understanding** – Analyze video by processing sequences of frames.
+* **Interleaved Multimodal Input** – Freely mix text and images in any order within a single prompt.
+* **Function Calling** – Native support for structured tool use, enabling agentic workflows.
+* **Coding** – Code generation, completion, and correction.
+* **Multilingual** – Out-of-the-box support for 35+ languages, pre-trained on 140+ languages.
+* **Audio** (E2B and E4B only) – Automatic speech recognition (ASR) and speech-to-translated-text translation across multiple languages.
+
+
+## Getting Started
+
+You can use all Gemma 4 models with the latest version of Transformers. To get started, install the necessary dependencies in your environment:
+
+`pip install -U transformers torch accelerate`
+
+Once you have everything installed, you can proceed to load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForCausalLM
+
+MODEL_ID = "google/gemma-4-E4B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForCausalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output:
+
+```python
+# Prompt
+messages = [
+ {"role": "system", "content": "You are a helpful assistant."},
+ {"role": "user", "content": "Write a short joke about saving RAM."},
+]
+
+# Process input
+text = processor.apply_chat_template(
+ messages,
+ tokenize=False,
+ add_generation_prompt=True,
+ enable_thinking=False
+)
+inputs = processor(text=text, return_tensors="pt").to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=1024)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+To enable reasoning, set `enable_thinking=True` and the `parse_response` function will take care of parsing the thinking output.
+
+Below, you will also find snippets for processing audio (E2B and E4B only), images, and video alongside text:
+
+
+Code for processing Audio
+
+Instead of using `AutoModelForCausalLM`, you can use `AutoModelForMultimodalLM` to process audio. To use it, make sure to install the following packages:
+
+
+`pip install -U transformers torch torchvision librosa accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-E4B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the audio URL in the prompt:
+
+
+```python
+# Prompt - add audio before text
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {"type": "audio", "audio": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/Demos/sample-data/journal1.wav"},
+ {"type": "text", "text": "Transcribe the following speech segment in its original language. Follow these specific instructions for formatting the answer:\n* Only output the transcription, with no newlines.\n* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three."},
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+Code for processing Images
+
+Instead of using `AutoModelForCausalLM`, you can use `AutoModelForMultimodalLM` to process images. To use it, make sure to install the following packages:
+
+
+`pip install -U transformers torch torchvision accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-E4B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the image URL in the prompt:
+
+
+```python
+# Prompt - add image before text
+messages = [
+ {
+ "role": "user", "content": [
+ {"type": "image", "url": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/Demos/sample-data/GoldenGate.png"},
+ {"type": "text", "text": "What is shown in this image?"}
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+
+Code for processing Videos
+
+Instead of using `AutoModelForCausalLM`, you can use `AutoModelForMultimodalLM` to process videos. To use it, make sure to install the following packages:
+
+`pip install -U transformers torch torchvision librosa accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-E4B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the video URL in the prompt:
+
+
+```python
+# Prompt - add video before text
+messages = [
+ {
+ 'role': 'user',
+ 'content': [
+ {"type": "video", "video": "https://github.com/bebechien/gemma/raw/refs/heads/main/videos/ForBiggerBlazes.mp4"},
+ {'type': 'text', 'text': 'Describe this video.'}
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+
+## **Best Practices**
+
+For the best performance, use these configurations and best practices:
+
+### 1. Sampling Parameters
+
+Use the following standardized sampling configuration across all use cases:
+
+* `temperature=1.0`
+* `top_p=0.95`
+* `top_k=64`
+
+### 2. Thinking Mode Configuration
+
+Compared to Gemma 3, the models use standard `system`, `assistant`, and `user` roles. To properly manage the thinking process, use the following control tokens:
+
+* **Trigger Thinking:** Thinking is enabled by including the `<|think|>` token at the start of the system prompt. To disable thinking, remove the token.
+* **Standard Generation:** When thinking is enabled, the model will output its internal reasoning followed by the final answer using this structure:
+ `<|channel>thought\n`**[Internal reasoning]**``
+* **Disabled Thinking Behavior:** For all models except for the E2B and E4B variants, if thinking is disabled, the model will still generate the tags but with an empty thought block:
+ `<|channel>thought\n`**[Final answer]**
+
+> [!Note]
+> Note that many libraries like Transformers and llama.cpp handle the complexities of the chat template for you.
+
+### 3. Multi-Turn Conversations
+
+* **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final response. Thoughts from previous model turns must *not be added* before the next user turn begins.
+
+### 4. Modality order
+
+* For optimal performance with multimodal inputs, place image and/or audio content **before** the text in your prompt.
+
+### 5. Variable Image Resolution
+
+Aside from variable aspect ratios, Gemma 4 supports variable image resolution through a configurable visual token budget, which controls how many tokens are used to represent an image. A higher token budget preserves more visual detail at the cost of additional compute, while a lower budget enables faster inference for tasks that don't require fine-grained understanding.
+
+* The supported token budgets are: **70**, **140**, **280**, **560**, and **1120**.
+ * Use *lower budgets* for classification, captioning, or video understanding, where faster inference and processing many frames outweigh fine-grained detail.
+ * Use *higher budgets* for tasks like OCR, document parsing, or reading small text.
+
+### 6. Audio
+
+Use the following prompt structures for audio processing:
+
+* **Audio Speech Recognition (ASR)**
+
+```text
+Transcribe the following speech segment in {LANGUAGE} into {LANGUAGE} text.
+
+Follow these specific instructions for formatting the answer:
+* Only output the transcription, with no newlines.
+* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three.
+```
+
+* **Automatic Speech Translation (AST)**
+
+```text
+Transcribe the following speech segment in {SOURCE_LANGUAGE}, then translate it into {TARGET_LANGUAGE}.
+When formatting the answer, first output the transcription in {SOURCE_LANGUAGE}, then one newline, then output the string '{TARGET_LANGUAGE}: ', then the translation in {TARGET_LANGUAGE}.
+```
+
+### 7. Audio and Video Length
+
+All models support image inputs and can process videos as frames whereas the E2B and E4B models also support audio inputs. Audio supports a maximum length of 30 seconds. Video supports a maximum of 60 seconds assuming the images are processed at one frame per second.
+
+## **Model Data**
+
+Data used for model training and how the data was processed.
+
+### **Training Dataset**
+
+Our pre-training dataset is a large-scale, diverse collection of data encompassing a wide range of domains and modalities, which includes web documents, code, images, audio, with a cutoff date of January 2025. Here are the key components:
+
+* **Web Documents**: A diverse collection of web text ensures the model is exposed to a broad range of linguistic styles, topics, and vocabulary. The training dataset includes content in over 140 languages.
+* **Code**: Exposing the model to code helps it to learn the syntax and patterns of programming languages, which improves its ability to generate code and understand code-related questions.
+* **Mathematics**: Training on mathematical text helps the model learn logical reasoning, symbolic representation, and to address mathematical queries.
+* **Images**: A wide range of images enables the model to perform image analysis and visual data extraction tasks.
+
+The combination of these diverse data sources is crucial for training a powerful multimodal model that can handle a wide variety of different tasks and data formats.
+
+### **Data Preprocessing**
+
+Here are the key data cleaning and filtering methods applied to the training data:
+
+* **CSAM Filtering**: Rigorous CSAM (Child Sexual Abuse Material) filtering was applied at multiple stages in the data preparation process to ensure the exclusion of harmful and illegal content.
+* **Sensitive Data Filtering**: As part of making Gemma pre-trained models safe and reliable, automated techniques were used to filter out certain personal information and other sensitive data from training sets.
+* **Additional methods**: Filtering based on content quality and safety in line with [our policies](https://ai.google/static/documents/ai-responsibility-update-published-february-2025.pdf).
+
+## **Ethics and Safety**
+
+As open models become central to enterprise infrastructure, provenance and security are paramount. Developed by Google DeepMind, Gemma 4 undergoes the same rigorous safety evaluations as our proprietary Gemini models.
+
+### **Evaluation Approach**
+
+Gemma 4 models were developed in partnership with internal safety and responsible AI teams. A range of automated as well as human evaluations were conducted to help improve model safety. These evaluations align with [Google’s AI principles](https://ai.google/principles/), as well as safety policies, which aim to prevent our generative AI models from generating harmful content, including:
+
+* Content related to child sexual abuse material and exploitation
+* Dangerous content (e.g., promoting suicide, or instructing in activities that could cause real-world harm)
+* Sexually explicit content
+* Hate speech (e.g., dehumanizing members of protected groups)
+* Harassment (e.g., encouraging violence against people)
+
+### **Evaluation Results**
+
+For all areas of safety testing, we saw major improvements in all categories of content safety relative to previous Gemma models. Overall, Gemma 4 models significantly outperform Gemma 3 and 3n models in improving safety, while keeping unjustified refusals low. All testing was conducted without safety filters to evaluate the model capabilities and behaviors. For both text-to-text and image-to-text, and across all model sizes, the model produced minimal policy violations, and showed significant improvements over previous Gemma models' performance.
+
+## **Usage and Limitations**
+
+These models have certain limitations that users should be aware of.
+
+### **Intended Usage**
+
+Multimodal models (capable of processing vision, language, and/or audio) have a wide range of applications across various industries and domains. The following list of potential uses is not comprehensive. The purpose of this list is to provide contextual information about the possible use-cases that the model creators considered as part of model training and development.
+
+* **Content Creation and Communication**
+ * **Text Generation**: These models can be used to generate creative text formats such as poems, scripts, code, marketing copy, and email drafts.
+ * **Chatbots and Conversational AI**: Power conversational interfaces for customer service, virtual assistants, or interactive applications.
+ * **Text Summarization**: Generate concise summaries of a text corpus, research papers, or reports.
+ * **Image Data Extraction**: These models can be used to extract, interpret, and summarize visual data for text communications.
+ * **Audio Processing and Interaction**: The smaller models (E2B and E4B) can analyze and interpret audio inputs, enabling voice-driven interactions and transcriptions.
+* **Research and Education**
+ * **Natural Language Processing (NLP) and VLM Research**: These models can serve as a foundation for researchers to experiment with VLM and NLP techniques, develop algorithms, and contribute to the advancement of the field.
+ * **Language Learning Tools**: Support interactive language learning experiences, aiding in grammar correction or providing writing practice.
+ * **Knowledge Exploration**: Assist researchers in exploring large bodies of text by generating summaries or answering questions about specific topics.
+
+### **Limitations**
+
+* **Training Data**
+ * The quality and diversity of the training data significantly influence the model's capabilities. Biases or gaps in the training data can lead to limitations in the model's responses.
+ * The scope of the training dataset determines the subject areas the model can handle effectively.
+* **Context and Task Complexity**
+ * Models perform well on tasks that can be framed with clear prompts and instructions. Open-ended or highly complex tasks might be challenging.
+ * A model's performance can be influenced by the amount of context provided (longer context generally leads to better outputs, up to a certain point).
+* **Language Ambiguity and Nuance**
+ * Natural language is inherently complex. Models might struggle to grasp subtle nuances, sarcasm, or figurative language.
+* **Factual Accuracy**
+ * Models generate responses based on information they learned from their training datasets, but they are not knowledge bases. They may generate incorrect or outdated factual statements.
+* **Common Sense**
+ * Models rely on statistical patterns in language. They might lack the ability to apply common sense reasoning in certain situations.
+
+### **Ethical Considerations and Risks**
+
+The development of vision-language models (VLMs) raises several ethical concerns. In creating an open model, we have carefully considered the following:
+
+* **Bias and Fairness**
+ * VLMs trained on large-scale, real-world text and image data can reflect socio-cultural biases embedded in the training material. Gemma 4 models underwent careful scrutiny, input data pre-processing, and post-training evaluations as reported in this card to help mitigate the risk of these biases.
+* **Misinformation and Misuse**
+ * VLMs can be misused to generate text that is false, misleading, or harmful.
+ * Guidelines are provided for responsible use with the model, see the [Responsible Generative AI Toolkit](https://ai.google.dev/responsible).
+* **Transparency and Accountability**
+ * This model card summarizes details on the models' architecture, capabilities, limitations, and evaluation processes.
+ * A responsibly developed open model offers the opportunity to share innovation by making VLM technology accessible to developers and researchers across the AI ecosystem.
+
+**Risks identified and mitigations**:
+
+* **Generation of harmful content**: Mechanisms and guidelines for content safety are essential. Developers are encouraged to exercise caution and implement appropriate content safety safeguards based on their specific product policies and application use cases.
+* **Misuse for malicious purposes**: Technical limitations and developer and end-user education can help mitigate against malicious applications of VLMs. Educational resources and reporting mechanisms for users to flag misuse are provided.
+* **Privacy violations**: Models were trained on data filtered for removal of certain personal information and other sensitive data. Developers are encouraged to adhere to privacy regulations with privacy-preserving techniques.
+* **Perpetuation of biases**: It's encouraged to perform continuous monitoring (using evaluation metrics, human review) and the exploration of de-biasing techniques during model training, fine-tuning, and other use cases.
+
+### **Benefits**
+
+At the time of release, this family of models provides high-performance open vision-language model implementations designed from the ground up for responsible AI development compared to similarly sized models.
diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/config.json b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/config.json
new file mode 100644
index 0000000..9cb811d
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/config.json
@@ -0,0 +1,197 @@
+{
+ "architectures": [
+ "Gemma4ForConditionalGeneration"
+ ],
+ "audio_config": {
+ "_name_or_path": "",
+ "architectures": null,
+ "attention_chunk_size": 12,
+ "attention_context_left": 13,
+ "attention_context_right": 0,
+ "attention_invalid_logits_value": -1000000000.0,
+ "attention_logit_cap": 50.0,
+ "chunk_size_feed_forward": 0,
+ "conv_kernel_size": 5,
+ "torch_dtype": "bfloat16",
+ "gradient_clipping": 10000000000.0,
+ "hidden_act": "silu",
+ "hidden_size": 1024,
+ "id2label": {
+ "0": "LABEL_0",
+ "1": "LABEL_1"
+ },
+ "initializer_range": 0.02,
+ "is_encoder_decoder": false,
+ "label2id": {
+ "LABEL_0": 0,
+ "LABEL_1": 1
+ },
+ "model_type": "gemma4_audio",
+ "num_attention_heads": 8,
+ "num_hidden_layers": 12,
+ "output_attentions": false,
+ "output_hidden_states": false,
+ "output_proj_dims": 1536,
+ "problem_type": null,
+ "residual_weight": 0.5,
+ "return_dict": true,
+ "rms_norm_eps": 1e-06,
+ "subsampling_conv_channels": [
+ 128,
+ 32
+ ],
+ "use_clipped_linears": true
+ },
+ "audio_token_id": 258881,
+ "boa_token_id": 256000,
+ "boi_token_id": 255999,
+ "torch_dtype": "bfloat16",
+ "eoa_token_id": 258883,
+ "eoa_token_index": 258883,
+ "eoi_token_id": 258882,
+ "eos_token_id": 106,
+ "image_token_id": 258880,
+ "initializer_range": 0.02,
+ "model_type": "gemma4",
+ "pad_token_id": 0,
+ "text_config": {
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "attention_k_eq_v": false,
+ "bos_token_id": 2,
+ "torch_dtype": "bfloat16",
+ "enable_moe_block": false,
+ "eos_token_id": 1,
+ "expert_intermediate_size": null,
+ "final_logit_softcapping": 30.0,
+ "global_head_dim": 512,
+ "head_dim": 256,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 2560,
+ "hidden_size_per_layer_input": 256,
+ "initializer_range": 0.02,
+ "intermediate_size": 10240,
+ "layer_types": [
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 131072,
+ "model_type": "gemma4_text",
+ "moe_intermediate_size": null,
+ "num_attention_heads": 8,
+ "num_experts": null,
+ "num_global_key_value_heads": null,
+ "num_hidden_layers": 42,
+ "num_key_value_heads": 2,
+ "num_kv_shared_layers": 18,
+ "pad_token_id": 0,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "full_attention": {
+ "partial_rotary_factor": 0.25,
+ "rope_theta": 1000000.0,
+ "rope_type": "proportional"
+ },
+ "sliding_attention": {
+ "rope_theta": 10000.0,
+ "rope_type": "default"
+ }
+ },
+ "sliding_window": 512,
+ "tie_word_embeddings": true,
+ "top_k_experts": null,
+ "use_bidirectional_attention": null,
+ "use_cache": true,
+ "use_double_wide_mlp": false,
+ "vocab_size": 262144,
+ "vocab_size_per_layer_input": 262144
+ },
+ "tie_word_embeddings": true,
+ "transformers_version": "5.5.0.dev0",
+ "unsloth_fixed": true,
+ "video_token_id": 258884,
+ "vision_config": {
+ "_name_or_path": "",
+ "architectures": null,
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "chunk_size_feed_forward": 0,
+ "default_output_length": 280,
+ "torch_dtype": "bfloat16",
+ "global_head_dim": 64,
+ "head_dim": 64,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 768,
+ "id2label": {
+ "0": "LABEL_0",
+ "1": "LABEL_1"
+ },
+ "initializer_range": 0.02,
+ "intermediate_size": 3072,
+ "is_encoder_decoder": false,
+ "label2id": {
+ "LABEL_0": 0,
+ "LABEL_1": 1
+ },
+ "max_position_embeddings": 131072,
+ "model_type": "gemma4_vision",
+ "num_attention_heads": 12,
+ "num_hidden_layers": 16,
+ "num_key_value_heads": 12,
+ "output_attentions": false,
+ "output_hidden_states": false,
+ "patch_size": 16,
+ "pooling_kernel_size": 3,
+ "position_embedding_size": 10240,
+ "problem_type": null,
+ "return_dict": true,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 100.0,
+ "rope_type": "default"
+ },
+ "standardize": false,
+ "use_clipped_linears": true
+ },
+ "vision_soft_tokens_per_image": 280
+}
\ No newline at end of file
diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/gemma-4-E4B-it-Q4_K_M.gguf b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/gemma-4-E4B-it-Q4_K_M.gguf
new file mode 100644
index 0000000..a1f2f31
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/gemma-4-E4B-it-Q4_K_M.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:519b9793ed6ce0ff530f1b7c96e848e08e49e7af4d57bb97f76215963a54146d
+size 4977169568
diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/mmproj-F16.gguf
new file mode 100644
index 0000000..a260ff2
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/mmproj-F16.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ddf46c21d7078e95338cfc22306b19b276a29a5ad089023449dd54d4b6170a51
+size 990372672
diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/README.md b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/README.md
new file mode 100644
index 0000000..64526e1
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/README.md
@@ -0,0 +1,578 @@
+---
+library_name: transformers
+license: apache-2.0
+license_link: https://ai.google.dev/gemma/docs/gemma_4_license
+pipeline_tag: any-to-any
+base_model: google/gemma-4-E4B-it-qat-mobile-transformers
+tags:
+- gemma4
+- unsloth
+- gemma
+- google
+---
+# Read our How to [Run Gemma 4 QAT Guide!](https://unsloth.ai/docs/models/gemma-4/qat)
+
+
+
+
+
+
+## Run with MTP (speculative decoding)
+
+This model ships a Multi-Token Prediction drafter at the repo root (`mtp-gemma-4-E4B-it.gguf`, a near-lossless smart Q4_0). A recent llama.cpp auto-discovers it from `-hf`, so you do not pass `--model-draft`:
+
+```bash
+./build/bin/llama-server \
+ -hf unsloth/gemma-4-E4B-it-qat-mobile-GGUF:UD-Q2_K_XL \
+ --spec-type draft-mtp --spec-draft-n-max 4 \
+ -ngl 999 -fa off
+```
+
+The drafter shares the target's KV cache and does not change the output (the target verifies every drafted token). See the `MTP/` folder for the other precisions and explicit usage.
+
+
+
+
+
+
+
+
+ Hugging Face |
+ GitHub |
+ Launch Blog |
+ Documentation
+
+ License : Apache 2.0 | Authors : Google DeepMind
+
+
+> [!Note]
+> This model card is for the new versions of the Gemma 4 family optimized with Quantization-Aware Training (QAT), which allows preserving similar quality to bfloat16 while dramatically reducing the memory requirements to load the model.
+> Four versions of the QAT checkpoints are available:
+> * **Unquantized QAT checkpoints** (Q4_0): Half-precision weights extracted from the QAT pipeline, ideal for custom downstream compilation and research. Available for Gemma 4 E2B, E4B, 12B, 26B A4B, and 31B, and their drafter models.
+> * **GGUF** (Q4_0): Ready-to-deploy formats for broad ecosystem compatibility. Available for Gemma 4 E2B, E4B, 12B, 26B A4B, and 31B.
+> * **Mobile-optimized** (wNa8o8): A custom schema engineered explicitly for mobile hardware efficiency. It features targeted 2-bit decoding layers, optimized KV caches, and static activations to maximize VRAM savings. Available for Gemma 4 E2B and E4B.
+> * **Compressed Tensors** (w4a16): QAT checkpoints serialized in the compressed-tensors format for native, optimized inference with vLLM. Available for Gemma 4 E2B, E4B, 12B, and 31B.
+
+Gemma is a family of open models built by Google DeepMind. Gemma 4 models are multimodal, handling text and image input (with audio supported on E2B, E4B, and 12B) and generating text output. This release includes open-weights models in both pre-trained and instruction-tuned variants. Gemma 4 features a context window of up to 256K tokens and maintains multilingual support in over 140 languages.
+
+Featuring both Dense and Mixture-of-Experts (MoE) architectures, Gemma 4 is well-suited for tasks like text generation, coding, and reasoning. The models are available in five distinct sizes: **E2B**, **E4B**, **12B**, **26B A4B**, and **31B**. Their diverse sizes make them deployable in environments ranging from high-end phones to laptops and servers, democratizing access to state-of-the-art AI.
+
+Gemma 4 introduces key **capability and architectural advancements**:
+
+* **Reasoning** – All models in the family are designed as highly capable reasoners, with configurable thinking modes.
+
+* **Extended Multimodalities** – Processes Text, Image with variable aspect ratio and resolution support (all models), Video, and Audio (featured natively on the E2B, E4B, and 12B models).
+
+* **Diverse & Efficient Architectures** – Offers Dense and Mixture-of-Experts (MoE) variants of different sizes for scalable deployment.
+
+* **Optimized for On-Device** – Smaller models are specifically designed for efficient local execution on laptops and mobile devices.
+
+* **Increased Context Window** – The small models feature a 128K context window, while the medium models support 256K.
+
+* **Enhanced Coding & Agentic Capabilities** – Achieves notable improvements in coding benchmarks alongside native function-calling support, powering highly capable autonomous agents.
+
+* **Native System Prompt Support** – Gemma 4 introduces native support for the `system` role, enabling more structured and controllable conversations.
+
+## **Models Overview**
+
+Gemma 4 models are designed to deliver frontier-level performance at each size, targeting deployment scenarios from mobile and edge devices (E2B, E4B) to consumer GPUs and workstations (12B, 26B A4B, 31B). They are well-suited for reasoning, agentic workflows, coding, and multimodal understanding.
+
+The models employ a hybrid attention mechanism that interleaves local sliding window attention with full global attention, ensuring the final layer is always global. This hybrid design delivers the processing speed and low memory footprint of a lightweight model without sacrificing the deep awareness required for complex, long-context tasks. To optimize memory for long contexts, global layers feature unified Keys and Values, and apply Proportional RoPE (p-RoPE).
+
+### Dense Models
+
+| Property | E2B | E4B | 12B Unified | 31B Dense |
+| :---- | :---- | :---- | :---- | :---- |
+| **Total Parameters** | 2.3B effective (5.1B with embeddings) | 4.5B effective (8B with embeddings) | 11.95B | 30.7B |
+| **Layers** | 35 | 42 | 48 | 60 |
+| **Sliding Window** | 512 tokens | 512 tokens | 1024 tokens | 1024 tokens |
+| **Context Length** | 128K tokens | 128K tokens | 256K tokens | 256K tokens |
+| **Vocabulary Size** | 262K | 262K | 262K | 262K |
+| **Supported Modalities** | Text, Image, Audio | Text, Image, Audio | Text, Image, Audio | Text, Image |
+| **Vision Encoder Parameters** | *~150M* | *~150M* | - | *~550M* |
+| **Audio Encoder Parameters** | *~300M* | *~300M* | - | No Audio |
+
+The "E" in E2B and E4B stands for "effective" parameters. The smaller models incorporate Per-Layer Embeddings (PLE) to maximize parameter efficiency in on-device deployments. Rather than adding more layers or parameters to the model, PLE gives each decoder layer its own small embedding for every token. These embedding tables are large but are only used for quick lookups, which is why the effective parameter count is much smaller than the total.
+
+The "Unified" in Gemma 4 12B Unified refers to its encoder-free architecture. Other Gemma 4 models use dedicated encoders to process multimodal data before passing it to the LLM. Gemma 4 12B eliminates these encoders entirely, projecting raw image patches and audio waveforms directly into the LLM's embedding space through lightweight linear layers. This unified approach means all modalities flow straight into a single decoder-only transformer, reducing multimodal latency and allowing the entire model to be fine-tuned in one pass.
+
+### Mixture-of-Experts (MoE) Model
+
+| Property | 26B A4B MoE |
+| :---- | :---- |
+| **Total Parameters** | 25.2B |
+| **Active Parameters** | 3.8B |
+| **Layers** | 30 |
+| **Sliding Window** | 1024 tokens |
+| **Context Length** | 256K tokens |
+| **Vocabulary Size** | 262K |
+| **Expert Count** | 8 active / 128 total and 1 shared |
+| **Supported Modalities** | Text, Image |
+| **Vision Encoder Parameters** | *~550M* |
+
+The "A" in 26B A4B stands for "active parameters" in contrast to the total number of parameters the model contains. By only activating a 4B subset of parameters during inference, the Mixture-of-Experts model runs much faster than its 26B total might suggest. This makes it an excellent choice for fast inference compared to the dense 31B model since it runs almost as fast as a 4B-parameter model.
+
+## **Benchmark Results**
+
+These models were evaluated against a large collection of different datasets and metrics to cover different aspects of text generation. Evaluation results marked in the table are for instruction-tuned models.
+
+| | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B Unified | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think) |
+| :---- | :---- | :---- | :---- | :---- | :---- | :---- |
+| MMLU Pro | 85.2% | 82.6% | 77.2% | 69.4% | 60.0% | 67.6% |
+| AIME 2026 no tools | 89.2% | 88.3% | 77.5% | 42.5% | 37.5% | 20.8% |
+| LiveCodeBench v6 | 80.0% | 77.1% | 72.0% | 52.0% | 44.0% | 29.1% |
+| Codeforces ELO | 2150 | 1718 | 1659 | 940 | 633 | 110 |
+| GPQA Diamond | 84.3% | 82.3% | 78.8% | 58.6% | 43.4% | 42.4% |
+| Tau2 (average over 3) | 76.9% | 68.2% | 69.0% | 42.2% | 24.5% | 16.2% |
+| HLE no tools | 19.5% | 8.7% | 5.2% | - | - | - |
+| HLE with search | 26.5% | 17.2% | - | - | - | - |
+| BigBench Extra Hard | 74.4% | 64.8% | 53.0% | 33.1% | 21.9% | 19.3% |
+| MMMLU | 88.4% | 86.3% | 83.4% | 76.6% | 67.4% | 70.7% |
+| **Vision** | | | | | | |
+| MMMU Pro | 76.9% | 73.8% | 69.1% | 52.6% | 44.2% | 49.7% |
+| OmniDocBench 1.5 (average edit distance, lower is better) | 0.131 | 0.149 | 0.164 | 0.181 | 0.290 | 0.365 |
+| MATH-Vision | 85.6% | 82.4% | 79.7% | 59.5% | 52.4% | 46.0% |
+| MedXPertQA MM | 61.3% | 58.1% | 48.7% | 28.7% | 23.5% | - |
+| **Audio** | | | | | | |
+| CoVoST | - | - | 38.5* | 35.54 | 33.47 | - |
+| FLEURS (lower is better) | - | - | 0.069* | 0.08 | 0.09 | - |
+| **Long Context** | | | | | | |
+| MRCR v2 8 needle 128k (average) | 66.4% | 44.1% | 43.4% | 25.4% | 19.1% | 13.5% |
+
+* Excluding Chinese language.
+
+## **Core Capabilities**
+
+Gemma 4 models handle a broad range of tasks across text, vision, and audio. Key capabilities include:
+
+* **Thinking** – Built-in reasoning mode that lets the model think step-by-step before answering.
+* **Long Context** – Context windows of up to 128K tokens (E2B/E4B) and 256K tokens (12B, 26B A4B/31B).
+* **Image Understanding** – Object detection, Document/PDF parsing, screen and UI understanding, chart comprehension, OCR (including multilingual), handwriting recognition, and pointing. Images can be processed at variable aspect ratios and resolutions.
+* **Video Understanding** – Analyze video by processing sequences of frames.
+* **Interleaved Multimodal Input** – Freely mix text and images in any order within a single prompt.
+* **Function Calling** – Native support for structured tool use, enabling agentic workflows.
+* **Coding** – Code generation, completion, and correction.
+* **Multilingual** – Out-of-the-box support for 35+ languages, pre-trained on 140+ languages.
+* **Audio** (E2B, E4B, and 12B only) – Automatic speech recognition (ASR) and speech-to-translated-text translation across multiple languages.
+
+
+## Getting Started
+
+You can use all Gemma 4 models with the latest version of Transformers. To get started, install the necessary dependencies in your environment:
+
+`pip install -U transformers torch accelerate`
+
+Once you have everything installed, you can proceed to load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-12B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output:
+
+```python
+# Prompt
+messages = [
+ {"role": "system", "content": "You are a helpful assistant."},
+ {"role": "user", "content": "Write a short joke about saving RAM."},
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+ enable_thinking=False
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=1024)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+To enable reasoning, set `enable_thinking=True` and the `parse_response` function will take care of parsing the thinking output.
+
+Below, you will also find snippets for processing audio (E2B, E4B, 12B only), images, and video alongside text:
+
+
+Code for processing Audio
+
+Make sure to install the following packages:
+
+`pip install -U transformers torch torchvision librosa accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-12B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the audio URL in the prompt:
+
+
+```python
+# Prompt - add audio after text
+messages = [
+ {
+ "role": "user",
+ "content": [
+ {"type": "text", "text": "Transcribe the following speech segment in its original language. Follow these specific instructions for formatting the answer:\n* Only output the transcription, with no newlines.\n* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three."},
+ {"type": "audio", "audio": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/apps/sample-data/journal1.wav"},
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+Code for processing Images
+
+Make sure to install the following packages:
+
+
+`pip install -U transformers torch torchvision accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-12B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the image URL in the prompt:
+
+
+```python
+# Prompt - add image before text
+messages = [
+ {
+ "role": "user", "content": [
+ {"type": "image", "url": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/apps/sample-data/GoldenGate.png"},
+ {"type": "text", "text": "What is shown in this image?"}
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+
+Code for processing Videos
+
+Make sure to install the following packages:
+
+`pip install -U transformers torch torchvision librosa accelerate`
+
+You can then load the model with the code below:
+
+```python
+from transformers import AutoProcessor, AutoModelForMultimodalLM
+
+MODEL_ID = "google/gemma-4-12B-it"
+
+# Load model
+processor = AutoProcessor.from_pretrained(MODEL_ID)
+model = AutoModelForMultimodalLM.from_pretrained(
+ MODEL_ID,
+ dtype="auto",
+ device_map="auto"
+)
+```
+
+Once the model is loaded, you can start generating output by directly referencing the video URL in the prompt:
+
+
+```python
+# Prompt - add video before text
+messages = [
+ {
+ 'role': 'user',
+ 'content': [
+ {"type": "video", "video": "https://github.com/bebechien/gemma/raw/refs/heads/main/videos/ForBiggerBlazes.mp4"},
+ {'type': 'text', 'text': 'Describe this video.'}
+ ]
+ }
+]
+
+# Process input
+inputs = processor.apply_chat_template(
+ messages,
+ tokenize=True,
+ return_dict=True,
+ return_tensors="pt",
+ add_generation_prompt=True,
+).to(model.device)
+input_len = inputs["input_ids"].shape[-1]
+
+# Generate output
+outputs = model.generate(**inputs, max_new_tokens=512)
+response = processor.decode(outputs[0][input_len:], skip_special_tokens=False)
+
+# Parse output
+processor.parse_response(response)
+```
+
+
+
+
+
+## **Best Practices**
+
+For the best performance, use these configurations and best practices:
+
+### 1. Sampling Parameters
+
+Use the following standardized sampling configuration across all use cases:
+
+* `temperature=1.0`
+* `top_p=0.95`
+* `top_k=64`
+
+### 2. Thinking Mode Configuration
+
+Compared to Gemma 3, the models use standard `system`, `assistant`, and `user` roles. To properly manage the thinking process, use the following control tokens:
+
+* **Trigger Thinking:** Thinking is enabled by including the `<|think|>` token at the start of the system prompt. To disable thinking, remove the token.
+* **Standard Generation:** When thinking is enabled, the model will output its internal reasoning followed by the final answer using this structure:
+ `<|channel>thought\n`**[Internal reasoning]**``
+* **Disabled Thinking Behavior:** For all models except for the E2B and E4B variants, if thinking is disabled, the model will still generate the tags but with an empty thought block:
+ `<|channel>thought\n`**[Final answer]**
+
+> [!Note]
+> Note that many libraries like Transformers and llama.cpp handle the complexities of the chat template for you.
+
+### 3. Multi-Turn Conversations
+
+* **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final response. Thoughts from previous model turns must *not be added* before the next user turn begins.
+
+### 4. Modality order
+
+For optimal performance with multimodal inputs, place:
+
+* Image content **before** the text in your prompt.
+* Audio content **after** the text in your prompt.
+
+### 5. Variable Image Resolution
+
+Aside from variable aspect ratios, Gemma 4 supports variable image resolution through a configurable visual token budget, which controls how many tokens are used to represent an image. A higher token budget preserves more visual detail at the cost of additional compute, while a lower budget enables faster inference for tasks that don't require fine-grained understanding.
+
+* The supported token budgets are: **70**, **140**, **280**, **560**, and **1120**.
+ * Use *lower budgets* for classification, captioning, or video understanding, where faster inference and processing many frames outweigh fine-grained detail.
+ * Use *higher budgets* for tasks like OCR, document parsing, or reading small text.
+
+### 6. Audio
+
+Use the following prompt structures for audio processing:
+
+* **Audio Speech Recognition (ASR)**
+
+```text
+Transcribe the following speech segment in {LANGUAGE} into {LANGUAGE} text.
+
+Follow these specific instructions for formatting the answer:
+* Only output the transcription, with no newlines.
+* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three.
+```
+
+* **Automatic Speech Translation (AST)**
+
+```text
+Transcribe the following speech segment in {SOURCE_LANGUAGE}, then translate it into {TARGET_LANGUAGE}.
+When formatting the answer, first output the transcription in {SOURCE_LANGUAGE}, then one newline, then output the string '{TARGET_LANGUAGE}: ', then the translation in {TARGET_LANGUAGE}.
+```
+
+### 7. Audio and Video Length
+
+All models support image inputs and can process videos as frames whereas the E2B, E4B, and 12B models also support audio inputs. Audio supports a maximum length of 30 seconds. Video supports a maximum of 60 seconds assuming the images are processed at one frame per second.
+
+## **Model Data**
+
+Data used for model training and how the data was processed.
+
+### **Training Dataset**
+
+Our pre-training dataset is a large-scale, diverse collection of data encompassing a wide range of domains and modalities, which includes web documents, code, images, audio, with a cutoff date of January 2025. Here are the key components:
+
+* **Web Documents**: A diverse collection of web text ensures the model is exposed to a broad range of linguistic styles, topics, and vocabulary. The training dataset includes content in over 140 languages.
+* **Code**: Exposing the model to code helps it to learn the syntax and patterns of programming languages, which improves its ability to generate code and understand code-related questions.
+* **Mathematics**: Training on mathematical text helps the model learn logical reasoning, symbolic representation, and to address mathematical queries.
+* **Images**: A wide range of images enables the model to perform image analysis and visual data extraction tasks.
+
+The combination of these diverse data sources is crucial for training a powerful multimodal model that can handle a wide variety of different tasks and data formats.
+
+### **Data Preprocessing**
+
+Here are the key data cleaning and filtering methods applied to the training data:
+
+* **CSAM Filtering**: Rigorous CSAM (Child Sexual Abuse Material) filtering was applied at multiple stages in the data preparation process to ensure the exclusion of harmful and illegal content.
+* **Sensitive Data Filtering**: As part of making Gemma pre-trained models safe and reliable, automated techniques were used to filter out certain personal information and other sensitive data from training sets.
+* **Additional methods**: Filtering based on content quality and safety in line with [our policies](https://ai.google/static/documents/ai-responsibility-update-published-february-2025.pdf).
+
+## **Ethics and Safety**
+
+As open models become central to enterprise infrastructure, provenance and security are paramount. Developed by Google DeepMind, Gemma 4 undergoes the same rigorous safety evaluations as our proprietary Gemini models.
+
+### **Evaluation Approach**
+
+Gemma 4 models were developed in partnership with internal safety and responsible AI teams. A range of automated as well as human evaluations were conducted to help improve model safety. These evaluations align with [Google’s AI principles](https://ai.google/principles/), as well as safety policies, which aim to prevent our generative AI models from generating harmful content, including:
+
+* Content related to child sexual abuse material and exploitation
+* Dangerous content (e.g., promoting suicide, or instructing in activities that could cause real-world harm)
+* Sexually explicit content
+* Hate speech (e.g., dehumanizing members of protected groups)
+* Harassment (e.g., encouraging violence against people)
+
+### **Evaluation Results**
+
+For all areas of safety testing, we saw major improvements in all categories of content safety relative to previous Gemma models. Overall, Gemma 4 models significantly outperform Gemma 3 and 3n models in improving safety, while keeping unjustified refusals low. All testing was conducted without safety filters to evaluate the model capabilities and behaviors. For both text-to-text and image-to-text, and across all model sizes, the model produced minimal policy violations, and showed significant improvements over previous Gemma models' performance.
+
+## **Usage and Limitations**
+
+These models have certain limitations that users should be aware of.
+
+### **Intended Usage**
+
+Multimodal models (capable of processing vision, language, and/or audio) have a wide range of applications across various industries and domains. The following list of potential uses is not comprehensive. The purpose of this list is to provide contextual information about the possible use-cases that the model creators considered as part of model training and development.
+
+* **Content Creation and Communication**
+ * **Text Generation**: These models can be used to generate creative text formats such as poems, scripts, code, marketing copy, and email drafts.
+ * **Chatbots and Conversational AI**: Power conversational interfaces for customer service, virtual assistants, or interactive applications.
+ * **Text Summarization**: Generate concise summaries of a text corpus, research papers, or reports.
+ * **Image Data Extraction**: These models can be used to extract, interpret, and summarize visual data for text communications.
+ * **Audio Processing and Interaction**: The E2B, E4B, and 12B models can analyze and interpret audio inputs, enabling voice-driven interactions and transcriptions.
+* **Research and Education**
+ * **Natural Language Processing (NLP) and VLM Research**: These models can serve as a foundation for researchers to experiment with VLM and NLP techniques, develop algorithms, and contribute to the advancement of the field.
+ * **Language Learning Tools**: Support interactive language learning experiences, aiding in grammar correction or providing writing practice.
+ * **Knowledge Exploration**: Assist researchers in exploring large bodies of text by generating summaries or answering questions about specific topics.
+
+### **Limitations**
+
+* **Training Data**
+ * The quality and diversity of the training data significantly influence the model's capabilities. Biases or gaps in the training data can lead to limitations in the model's responses.
+ * The scope of the training dataset determines the subject areas the model can handle effectively.
+* **Context and Task Complexity**
+ * Models perform well on tasks that can be framed with clear prompts and instructions. Open-ended or highly complex tasks might be challenging.
+ * A model's performance can be influenced by the amount of context provided (longer context generally leads to better outputs, up to a certain point).
+* **Language Ambiguity and Nuance**
+ * Natural language is inherently complex. Models might struggle to grasp subtle nuances, sarcasm, or figurative language.
+* **Factual Accuracy**
+ * Models generate responses based on information they learned from their training datasets, but they are not knowledge bases. They may generate incorrect or outdated factual statements.
+* **Common Sense**
+ * Models rely on statistical patterns in language. They might lack the ability to apply common sense reasoning in certain situations.
+
+### **Ethical Considerations and Risks**
+
+The development of vision-language models (VLMs) raises several ethical concerns. In creating an open model, we have carefully considered the following:
+
+* **Bias and Fairness**
+ * VLMs trained on large-scale, real-world text and image data can reflect socio-cultural biases embedded in the training material. Gemma 4 models underwent careful scrutiny, input data pre-processing, and post-training evaluations as reported in this card to help mitigate the risk of these biases.
+* **Misinformation and Misuse**
+ * VLMs can be misused to generate text that is false, misleading, or harmful.
+ * Guidelines are provided for responsible use with the model, see the [Responsible Generative AI Toolkit](https://ai.google.dev/responsible).
+* **Transparency and Accountability**
+ * This model card summarizes details on the models' architecture, capabilities, limitations, and evaluation processes.
+ * A responsibly developed open model offers the opportunity to share innovation by making VLM technology accessible to developers and researchers across the AI ecosystem.
+
+**Risks identified and mitigations**:
+
+* **Generation of harmful content**: Mechanisms and guidelines for content safety are essential. Developers are encouraged to exercise caution and implement appropriate content safety safeguards based on their specific product policies and application use cases.
+* **Misuse for malicious purposes**: Technical limitations and developer and end-user education can help mitigate against malicious applications of VLMs. Educational resources and reporting mechanisms for users to flag misuse are provided.
+* **Privacy violations**: Models were trained on data filtered for removal of certain personal information and other sensitive data. Developers are encouraged to adhere to privacy regulations with privacy-preserving techniques.
+* **Perpetuation of biases**: It's encouraged to perform continuous monitoring (using evaluation metrics, human review) and the exploration of de-biasing techniques during model training, fine-tuning, and other use cases.
+
+### **Benefits**
+
+At the time of release, this family of models provides high-performance open vision-language model implementations designed from the ground up for responsible AI development compared to similarly sized models.
\ No newline at end of file
diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/config.json b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/config.json
new file mode 100644
index 0000000..9cb811d
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/config.json
@@ -0,0 +1,197 @@
+{
+ "architectures": [
+ "Gemma4ForConditionalGeneration"
+ ],
+ "audio_config": {
+ "_name_or_path": "",
+ "architectures": null,
+ "attention_chunk_size": 12,
+ "attention_context_left": 13,
+ "attention_context_right": 0,
+ "attention_invalid_logits_value": -1000000000.0,
+ "attention_logit_cap": 50.0,
+ "chunk_size_feed_forward": 0,
+ "conv_kernel_size": 5,
+ "torch_dtype": "bfloat16",
+ "gradient_clipping": 10000000000.0,
+ "hidden_act": "silu",
+ "hidden_size": 1024,
+ "id2label": {
+ "0": "LABEL_0",
+ "1": "LABEL_1"
+ },
+ "initializer_range": 0.02,
+ "is_encoder_decoder": false,
+ "label2id": {
+ "LABEL_0": 0,
+ "LABEL_1": 1
+ },
+ "model_type": "gemma4_audio",
+ "num_attention_heads": 8,
+ "num_hidden_layers": 12,
+ "output_attentions": false,
+ "output_hidden_states": false,
+ "output_proj_dims": 1536,
+ "problem_type": null,
+ "residual_weight": 0.5,
+ "return_dict": true,
+ "rms_norm_eps": 1e-06,
+ "subsampling_conv_channels": [
+ 128,
+ 32
+ ],
+ "use_clipped_linears": true
+ },
+ "audio_token_id": 258881,
+ "boa_token_id": 256000,
+ "boi_token_id": 255999,
+ "torch_dtype": "bfloat16",
+ "eoa_token_id": 258883,
+ "eoa_token_index": 258883,
+ "eoi_token_id": 258882,
+ "eos_token_id": 106,
+ "image_token_id": 258880,
+ "initializer_range": 0.02,
+ "model_type": "gemma4",
+ "pad_token_id": 0,
+ "text_config": {
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "attention_k_eq_v": false,
+ "bos_token_id": 2,
+ "torch_dtype": "bfloat16",
+ "enable_moe_block": false,
+ "eos_token_id": 1,
+ "expert_intermediate_size": null,
+ "final_logit_softcapping": 30.0,
+ "global_head_dim": 512,
+ "head_dim": 256,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 2560,
+ "hidden_size_per_layer_input": 256,
+ "initializer_range": 0.02,
+ "intermediate_size": 10240,
+ "layer_types": [
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 131072,
+ "model_type": "gemma4_text",
+ "moe_intermediate_size": null,
+ "num_attention_heads": 8,
+ "num_experts": null,
+ "num_global_key_value_heads": null,
+ "num_hidden_layers": 42,
+ "num_key_value_heads": 2,
+ "num_kv_shared_layers": 18,
+ "pad_token_id": 0,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "full_attention": {
+ "partial_rotary_factor": 0.25,
+ "rope_theta": 1000000.0,
+ "rope_type": "proportional"
+ },
+ "sliding_attention": {
+ "rope_theta": 10000.0,
+ "rope_type": "default"
+ }
+ },
+ "sliding_window": 512,
+ "tie_word_embeddings": true,
+ "top_k_experts": null,
+ "use_bidirectional_attention": null,
+ "use_cache": true,
+ "use_double_wide_mlp": false,
+ "vocab_size": 262144,
+ "vocab_size_per_layer_input": 262144
+ },
+ "tie_word_embeddings": true,
+ "transformers_version": "5.5.0.dev0",
+ "unsloth_fixed": true,
+ "video_token_id": 258884,
+ "vision_config": {
+ "_name_or_path": "",
+ "architectures": null,
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "chunk_size_feed_forward": 0,
+ "default_output_length": 280,
+ "torch_dtype": "bfloat16",
+ "global_head_dim": 64,
+ "head_dim": 64,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 768,
+ "id2label": {
+ "0": "LABEL_0",
+ "1": "LABEL_1"
+ },
+ "initializer_range": 0.02,
+ "intermediate_size": 3072,
+ "is_encoder_decoder": false,
+ "label2id": {
+ "LABEL_0": 0,
+ "LABEL_1": 1
+ },
+ "max_position_embeddings": 131072,
+ "model_type": "gemma4_vision",
+ "num_attention_heads": 12,
+ "num_hidden_layers": 16,
+ "num_key_value_heads": 12,
+ "output_attentions": false,
+ "output_hidden_states": false,
+ "patch_size": 16,
+ "pooling_kernel_size": 3,
+ "position_embedding_size": 10240,
+ "problem_type": null,
+ "return_dict": true,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 100.0,
+ "rope_type": "default"
+ },
+ "standardize": false,
+ "use_clipped_linears": true
+ },
+ "vision_soft_tokens_per_image": 280
+}
\ No newline at end of file
diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/gemma-4-E4B-it-qat-UD-Q2_K_XL.gguf b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/gemma-4-E4B-it-qat-UD-Q2_K_XL.gguf
new file mode 100644
index 0000000..1072af5
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/gemma-4-E4B-it-qat-UD-Q2_K_XL.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:fa5add96dfe96039c24087e90a9239e9e15618df42df306d9043c7ae2f58184d
+size 3219530176
diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/mmproj-F16.gguf
new file mode 100644
index 0000000..a9ef767
--- /dev/null
+++ b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/mmproj-F16.gguf
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:6a255159ee4b01b304f633a57f017dd7d5a69d30fff52abb2614bf0813cef034
+size 990372672
diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/.gitattributes b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/.gitattributes
new file mode 100644
index 0000000..52373fe
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/.gitattributes
@@ -0,0 +1,36 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/README.md b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/README.md
new file mode 100644
index 0000000..3b04882
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/README.md
@@ -0,0 +1,75 @@
+---
+base_model: Qwen/Qwen3.5-0.8B
+library_name: mlx
+tags:
+ - mlx
+ - qwen3.5
+ - vision-language-model
+ - quantized
+ - 4bit
+license: apache-2.0
+---
+
+# Qwen3.5-0.8B-MLX-4bit
+
+This is a 4-bit quantized MLX version of [Qwen/Qwen3.5-0.8B](https://huggingface.co/Qwen/Qwen3.5-0.8B) for Apple Silicon.
+
+## Model Details
+
+- **Original Model:** [Qwen/Qwen3.5-0.8B](https://huggingface.co/Qwen/Qwen3.5-0.8B)
+- **Quantization:** 4-bit (5.863 bits per weight)
+- **Group Size:** 64
+- **Format:** MLX SafeTensors
+- **Framework:** [mlx-vlm](https://github.com/Blaizzy/mlx-vlm)
+- **Disk Size:** ~622M
+
+## Conversion Details
+
+This model was converted using `mlx-vlm` from the [`pc/fix-qwen35-predicate`](https://github.com/Blaizzy/mlx-vlm/tree/pc/fix-qwen35-predicate) branch, which includes fixes for Qwen3.5 model support (proper handling of MoE gate layers, `shared_expert_gate`, and `A_log` casting).
+
+**Conversion command:**
+```bash
+python3 -m mlx_vlm convert \
+ --hf-path "Qwen/Qwen3.5-0.8B" \
+ --mlx-path "./Qwen3.5-0.8B-MLX-4bit" \
+ -q --q-bits 4 --q-group-size 64
+```
+
+## Important Note
+
+A better, more optimized conversion may be available from **@Prince** ([@Blaizzy](https://huggingface.co/Blaizzy)) in the MLX VLM community. Check the [mlx-community](https://huggingface.co/mlx-community) organization for updated versions as official Qwen3.5 support is merged into the main `mlx-vlm` branch.
+
+## Related Models
+
+- **bf16 (full precision):** [mlx-community/Qwen3.5-0.8B-MLX-bf16](https://huggingface.co/mlx-community/Qwen3.5-0.8B-MLX-bf16)
+- **8-bit quantized:** [mlx-community/Qwen3.5-0.8B-MLX-8bit](https://huggingface.co/mlx-community/Qwen3.5-0.8B-MLX-8bit)
+- **Original:** [Qwen/Qwen3.5-0.8B](https://huggingface.co/Qwen/Qwen3.5-0.8B)
+
+## Usage
+
+```python
+from mlx_vlm import load, generate
+
+model, processor = load("mlx-community/Qwen3.5-0.8B-MLX-4bit")
+
+output = generate(
+ model,
+ processor,
+ prompt="Describe this image.",
+ image="path/to/image.jpg",
+ max_tokens=512
+)
+print(output)
+```
+
+**CLI:**
+```bash
+python3 -m mlx_vlm.generate \
+ --model mlx-community/Qwen3.5-0.8B-MLX-4bit \
+ --image path/to/image.jpg \
+ --prompt "Describe this image."
+```
+
+## License
+
+This model inherits the [Apache 2.0 license](https://huggingface.co/Qwen/Qwen3.5-0.8B) from the original Qwen model.
diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/chat_template.jinja b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/chat_template.jinja
new file mode 100644
index 0000000..0ef09f2
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n " }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n \n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n \n \n \n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n ' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith(' ')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split(' ')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n \n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n \n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- ' \n ' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n ' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is true %}
+ {{- '\n' }}
+ {%- else %}
+ {{- '\n\n \n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/config.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/config.json
new file mode 100644
index 0000000..f2a232f
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/config.json
@@ -0,0 +1,106 @@
+{
+ "architectures": [
+ "Qwen3_5ForConditionalGeneration"
+ ],
+ "image_token_id": 248056,
+ "model_type": "qwen3_5",
+ "quantization": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine"
+ },
+ "quantization_config": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine"
+ },
+ "text_config": {
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "attn_output_gate": true,
+ "dtype": "bfloat16",
+ "eos_token_id": 248044,
+ "full_attention_interval": 4,
+ "head_dim": 256,
+ "hidden_act": "silu",
+ "hidden_size": 1024,
+ "initializer_range": 0.02,
+ "intermediate_size": 3584,
+ "layer_types": [
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention"
+ ],
+ "linear_conv_kernel_dim": 4,
+ "linear_key_head_dim": 128,
+ "linear_num_key_heads": 16,
+ "linear_num_value_heads": 16,
+ "linear_value_head_dim": 128,
+ "max_position_embeddings": 262144,
+ "mlp_only_layers": [],
+ "model_type": "qwen3_5_text",
+ "mtp_num_hidden_layers": 1,
+ "mtp_use_dedicated_embeddings": false,
+ "num_attention_heads": 8,
+ "num_hidden_layers": 24,
+ "num_key_value_heads": 2,
+ "rms_norm_eps": 1e-06,
+ "tie_word_embeddings": true,
+ "use_cache": true,
+ "vocab_size": 248320,
+ "mamba_ssm_dtype": "float32",
+ "rope_parameters": {
+ "mrope_interleaved": true,
+ "mrope_section": [
+ 11,
+ 11,
+ 10
+ ],
+ "rope_type": "default",
+ "rope_theta": 10000000,
+ "partial_rotary_factor": 0.25
+ }
+ },
+ "tie_word_embeddings": true,
+ "transformers_version": "4.57.0.dev0",
+ "video_token_id": 248057,
+ "vision_config": {
+ "deepstack_visual_indexes": [],
+ "depth": 12,
+ "hidden_act": "gelu_pytorch_tanh",
+ "hidden_size": 768,
+ "in_channels": 3,
+ "initializer_range": 0.02,
+ "intermediate_size": 3072,
+ "model_type": "qwen3_5",
+ "num_heads": 12,
+ "num_position_embeddings": 2304,
+ "out_hidden_size": 1024,
+ "patch_size": 16,
+ "spatial_merge_size": 2,
+ "temporal_patch_size": 2
+ },
+ "vision_end_token_id": 248054,
+ "vision_start_token_id": 248053
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/model.safetensors b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/model.safetensors
new file mode 100644
index 0000000..60d8da0
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:f5a0d9dd3efa73510542a8023d610ff26be2b4b020d181cfc4bedaa1fcc5dd9e
+size 625229487
diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/model.safetensors.index.json
new file mode 100644
index 0000000..e9a7b62
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/model.safetensors.index.json
@@ -0,0 +1,854 @@
+{
+ "metadata": {
+ "total_size": 625124032
+ },
+ "weight_map": {
+ "language_model.model.embed_tokens.biases": "model.safetensors",
+ "language_model.model.embed_tokens.scales": "model.safetensors",
+ "language_model.model.embed_tokens.weight": "model.safetensors",
+ "language_model.model.layers.0.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.1.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.10.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.13.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.14.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.17.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.18.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.20.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.21.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.22.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.5.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.6.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.9.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.norm.weight": "model.safetensors",
+ "vision_tower.blocks.0.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.0.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.0.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.0.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.0.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.0.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.0.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.0.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.1.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.1.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.1.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.1.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.1.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.1.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.1.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.1.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.10.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.10.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.10.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.10.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.10.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.10.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.10.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.10.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.11.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.11.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.11.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.11.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.11.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.11.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.11.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.11.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.2.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.2.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.2.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.2.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.2.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.2.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.2.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.2.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.3.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.3.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.3.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.3.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.3.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.3.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.3.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.3.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.4.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.4.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.4.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.4.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.4.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.4.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.4.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.4.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.5.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.5.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.5.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.5.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.5.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.5.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.5.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.5.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.6.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.6.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.6.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.6.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.6.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.6.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.6.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.6.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.7.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.7.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.7.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.7.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.7.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.7.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.7.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.7.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.8.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.8.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.8.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.8.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.8.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.8.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.8.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.8.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.9.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.9.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.9.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.9.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.9.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.9.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.9.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.9.norm2.weight": "model.safetensors",
+ "vision_tower.merger.linear_fc1.bias": "model.safetensors",
+ "vision_tower.merger.linear_fc1.weight": "model.safetensors",
+ "vision_tower.merger.linear_fc2.bias": "model.safetensors",
+ "vision_tower.merger.linear_fc2.weight": "model.safetensors",
+ "vision_tower.merger.norm.bias": "model.safetensors",
+ "vision_tower.merger.norm.weight": "model.safetensors",
+ "vision_tower.patch_embed.proj.bias": "model.safetensors",
+ "vision_tower.patch_embed.proj.weight": "model.safetensors",
+ "vision_tower.pos_embed.weight": "model.safetensors"
+ }
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/preprocessor_config.json
new file mode 100644
index 0000000..2ea84a4
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/preprocessor_config.json
@@ -0,0 +1,21 @@
+{
+ "size": {
+ "longest_edge": 16777216,
+ "shortest_edge": 65536
+ },
+ "patch_size": 16,
+ "temporal_patch_size": 2,
+ "merge_size": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "processor_class": "Qwen3VLProcessor",
+ "image_processor_type": "Qwen2VLImageProcessorFast"
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/processor_config.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/processor_config.json
new file mode 100644
index 0000000..7ad6acd
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/processor_config.json
@@ -0,0 +1,63 @@
+{
+ "image_processor": {
+ "data_format": "channels_first",
+ "do_convert_rgb": true,
+ "do_normalize": true,
+ "do_rescale": true,
+ "do_resize": true,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_processor_type": "Qwen2VLImageProcessorFast",
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "merge_size": 2,
+ "patch_size": 16,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "size": {
+ "longest_edge": 16777216,
+ "shortest_edge": 65536
+ },
+ "temporal_patch_size": 2
+ },
+ "processor_class": "Qwen3VLProcessor",
+ "video_processor": {
+ "data_format": "channels_first",
+ "default_to_square": true,
+ "do_convert_rgb": true,
+ "do_normalize": true,
+ "do_rescale": true,
+ "do_resize": true,
+ "do_sample_frames": true,
+ "fps": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "max_frames": 768,
+ "merge_size": 2,
+ "min_frames": 4,
+ "patch_size": 16,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "return_metadata": false,
+ "size": {
+ "longest_edge": 25165824,
+ "shortest_edge": 4096
+ },
+ "temporal_patch_size": 2,
+ "video_processor_type": "Qwen3VLVideoProcessor"
+ }
+}
diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/tokenizer.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/tokenizer.json
new file mode 100644
index 0000000..67741b0
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4
+size 19989343
diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/tokenizer_config.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/tokenizer_config.json
new file mode 100644
index 0000000..a068e24
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/tokenizer_config.json
@@ -0,0 +1,32 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": true,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "processor_class": "Qwen3VLProcessor",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/video_preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/video_preprocessor_config.json
new file mode 100644
index 0000000..3ba673a
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/video_preprocessor_config.json
@@ -0,0 +1,21 @@
+{
+ "size": {
+ "longest_edge": 25165824,
+ "shortest_edge": 4096
+ },
+ "patch_size": 16,
+ "temporal_patch_size": 2,
+ "merge_size": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "processor_class": "Qwen3VLProcessor",
+ "video_processor_type": "Qwen3VLVideoProcessor"
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/vocab.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/vocab.json
new file mode 100644
index 0000000..d32f7ed
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/vocab.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ce99b4cb2983d118806ce0a8b777a35b093e2000a503ebde25853284c9dfa003
+size 6722759
diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/.gitattributes b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/.gitattributes
new file mode 100644
index 0000000..52373fe
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/.gitattributes
@@ -0,0 +1,36 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/README.md b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/README.md
new file mode 100644
index 0000000..27d920b
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/README.md
@@ -0,0 +1,75 @@
+---
+base_model: Qwen/Qwen3.5-2B
+library_name: mlx
+tags:
+ - mlx
+ - qwen3.5
+ - vision-language-model
+ - quantized
+ - 4bit
+license: apache-2.0
+---
+
+# Qwen3.5-2B-MLX-4bit
+
+This is a 4-bit quantized MLX version of [Qwen/Qwen3.5-2B](https://huggingface.co/Qwen/Qwen3.5-2B) for Apple Silicon.
+
+## Model Details
+
+- **Original Model:** [Qwen/Qwen3.5-2B](https://huggingface.co/Qwen/Qwen3.5-2B)
+- **Quantization:** 4-bit (6.225 bits per weight)
+- **Group Size:** 64
+- **Format:** MLX SafeTensors
+- **Framework:** [mlx-vlm](https://github.com/Blaizzy/mlx-vlm)
+- **Disk Size:** ~1.6G
+
+## Conversion Details
+
+This model was converted using `mlx-vlm` from the [`pc/fix-qwen35-predicate`](https://github.com/Blaizzy/mlx-vlm/tree/pc/fix-qwen35-predicate) branch, which includes fixes for Qwen3.5 model support (proper handling of MoE gate layers, `shared_expert_gate`, and `A_log` casting).
+
+**Conversion command:**
+```bash
+python3 -m mlx_vlm convert \
+ --hf-path "Qwen/Qwen3.5-2B" \
+ --mlx-path "./Qwen3.5-2B-MLX-4bit" \
+ -q --q-bits 4 --q-group-size 64
+```
+
+## Important Note
+
+A better, more optimized conversion may be available from **@Prince** ([@Blaizzy](https://huggingface.co/Blaizzy)) in the MLX VLM community. Check the [mlx-community](https://huggingface.co/mlx-community) organization for updated versions as official Qwen3.5 support is merged into the main `mlx-vlm` branch.
+
+## Related Models
+
+- **bf16 (full precision):** [mlx-community/Qwen3.5-2B-MLX-bf16](https://huggingface.co/mlx-community/Qwen3.5-2B-MLX-bf16)
+- **8-bit quantized:** [mlx-community/Qwen3.5-2B-MLX-8bit](https://huggingface.co/mlx-community/Qwen3.5-2B-MLX-8bit)
+- **Original:** [Qwen/Qwen3.5-2B](https://huggingface.co/Qwen/Qwen3.5-2B)
+
+## Usage
+
+```python
+from mlx_vlm import load, generate
+
+model, processor = load("mlx-community/Qwen3.5-2B-MLX-4bit")
+
+output = generate(
+ model,
+ processor,
+ prompt="Describe this image.",
+ image="path/to/image.jpg",
+ max_tokens=512
+)
+print(output)
+```
+
+**CLI:**
+```bash
+python3 -m mlx_vlm.generate \
+ --model mlx-community/Qwen3.5-2B-MLX-4bit \
+ --image path/to/image.jpg \
+ --prompt "Describe this image."
+```
+
+## License
+
+This model inherits the [Apache 2.0 license](https://huggingface.co/Qwen/Qwen3.5-2B) from the original Qwen model.
diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/chat_template.jinja b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/chat_template.jinja
new file mode 100644
index 0000000..0ef09f2
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n " }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n \n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n \n \n \n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n ' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith(' ')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if ' ' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split(' ')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n \n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n \n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- ' \n ' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n ' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is true %}
+ {{- '\n' }}
+ {%- else %}
+ {{- '\n\n \n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/config.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/config.json
new file mode 100644
index 0000000..6d90190
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/config.json
@@ -0,0 +1,106 @@
+{
+ "architectures": [
+ "Qwen3_5ForConditionalGeneration"
+ ],
+ "image_token_id": 248056,
+ "model_type": "qwen3_5",
+ "quantization": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine"
+ },
+ "quantization_config": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine"
+ },
+ "text_config": {
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "attn_output_gate": true,
+ "dtype": "bfloat16",
+ "eos_token_id": 248044,
+ "full_attention_interval": 4,
+ "head_dim": 256,
+ "hidden_act": "silu",
+ "hidden_size": 2048,
+ "initializer_range": 0.02,
+ "intermediate_size": 6144,
+ "layer_types": [
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention"
+ ],
+ "linear_conv_kernel_dim": 4,
+ "linear_key_head_dim": 128,
+ "linear_num_key_heads": 16,
+ "linear_num_value_heads": 16,
+ "linear_value_head_dim": 128,
+ "max_position_embeddings": 262144,
+ "mlp_only_layers": [],
+ "model_type": "qwen3_5_text",
+ "mtp_num_hidden_layers": 1,
+ "mtp_use_dedicated_embeddings": false,
+ "num_attention_heads": 8,
+ "num_hidden_layers": 24,
+ "num_key_value_heads": 2,
+ "rms_norm_eps": 1e-06,
+ "tie_word_embeddings": true,
+ "use_cache": true,
+ "vocab_size": 248320,
+ "mamba_ssm_dtype": "float32",
+ "rope_parameters": {
+ "mrope_interleaved": true,
+ "mrope_section": [
+ 11,
+ 11,
+ 10
+ ],
+ "rope_type": "default",
+ "rope_theta": 10000000,
+ "partial_rotary_factor": 0.25
+ }
+ },
+ "tie_word_embeddings": true,
+ "transformers_version": "4.57.0.dev0",
+ "video_token_id": 248057,
+ "vision_config": {
+ "deepstack_visual_indexes": [],
+ "depth": 24,
+ "hidden_act": "gelu_pytorch_tanh",
+ "hidden_size": 1024,
+ "in_channels": 3,
+ "initializer_range": 0.02,
+ "intermediate_size": 4096,
+ "model_type": "qwen3_5",
+ "num_heads": 16,
+ "num_position_embeddings": 2304,
+ "out_hidden_size": 2048,
+ "patch_size": 16,
+ "spatial_merge_size": 2,
+ "temporal_patch_size": 2
+ },
+ "vision_end_token_id": 248054,
+ "vision_start_token_id": 248053
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/model.safetensors b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/model.safetensors
new file mode 100644
index 0000000..13e3e26
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:713fe7e5d3c3965f7106b0d0ee17615f7869c23c8d327996df8c1196fbcf07d5
+size 1722271785
diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/model.safetensors.index.json
new file mode 100644
index 0000000..2d9ef9d
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/model.safetensors.index.json
@@ -0,0 +1,998 @@
+{
+ "metadata": {
+ "total_size": 1722149056
+ },
+ "weight_map": {
+ "language_model.model.embed_tokens.biases": "model.safetensors",
+ "language_model.model.embed_tokens.scales": "model.safetensors",
+ "language_model.model.embed_tokens.weight": "model.safetensors",
+ "language_model.model.layers.0.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.1.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.10.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.13.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.14.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.17.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.18.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.20.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.21.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.22.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.5.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.6.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.9.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.norm.weight": "model.safetensors",
+ "vision_tower.blocks.0.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.0.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.0.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.0.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.0.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.0.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.0.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.0.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.1.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.1.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.1.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.1.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.1.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.1.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.1.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.1.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.10.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.10.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.10.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.10.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.10.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.10.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.10.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.10.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.11.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.11.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.11.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.11.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.11.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.11.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.11.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.11.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.12.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.12.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.12.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.12.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.12.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.12.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.12.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.12.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.13.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.13.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.13.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.13.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.13.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.13.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.13.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.13.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.14.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.14.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.14.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.14.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.14.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.14.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.14.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.14.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.15.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.15.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.15.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.15.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.15.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.15.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.15.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.15.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.16.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.16.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.16.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.16.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.16.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.16.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.16.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.16.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.17.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.17.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.17.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.17.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.17.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.17.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.17.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.17.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.18.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.18.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.18.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.18.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.18.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.18.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.18.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.18.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.19.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.19.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.19.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.19.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.19.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.19.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.19.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.19.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.2.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.2.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.2.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.2.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.2.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.2.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.2.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.2.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.20.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.20.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.20.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.20.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.20.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.20.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.20.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.20.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.21.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.21.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.21.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.21.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.21.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.21.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.21.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.21.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.22.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.22.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.22.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.22.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.22.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.22.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.22.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.22.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.23.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.23.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.23.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.23.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.23.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.23.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.23.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.23.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.3.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.3.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.3.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.3.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.3.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.3.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.3.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.3.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.4.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.4.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.4.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.4.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.4.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.4.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.4.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.4.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.5.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.5.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.5.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.5.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.5.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.5.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.5.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.5.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.6.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.6.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.6.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.6.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.6.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.6.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.6.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.6.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.7.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.7.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.7.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.7.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.7.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.7.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.7.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.7.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.8.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.8.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.8.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.8.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.8.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.8.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.8.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.8.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.9.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.9.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.9.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.9.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.9.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.9.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.9.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.9.norm2.weight": "model.safetensors",
+ "vision_tower.merger.linear_fc1.bias": "model.safetensors",
+ "vision_tower.merger.linear_fc1.weight": "model.safetensors",
+ "vision_tower.merger.linear_fc2.bias": "model.safetensors",
+ "vision_tower.merger.linear_fc2.weight": "model.safetensors",
+ "vision_tower.merger.norm.bias": "model.safetensors",
+ "vision_tower.merger.norm.weight": "model.safetensors",
+ "vision_tower.patch_embed.proj.bias": "model.safetensors",
+ "vision_tower.patch_embed.proj.weight": "model.safetensors",
+ "vision_tower.pos_embed.weight": "model.safetensors"
+ }
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/preprocessor_config.json
new file mode 100644
index 0000000..2ea84a4
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/preprocessor_config.json
@@ -0,0 +1,21 @@
+{
+ "size": {
+ "longest_edge": 16777216,
+ "shortest_edge": 65536
+ },
+ "patch_size": 16,
+ "temporal_patch_size": 2,
+ "merge_size": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "processor_class": "Qwen3VLProcessor",
+ "image_processor_type": "Qwen2VLImageProcessorFast"
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/processor_config.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/processor_config.json
new file mode 100644
index 0000000..7ad6acd
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/processor_config.json
@@ -0,0 +1,63 @@
+{
+ "image_processor": {
+ "data_format": "channels_first",
+ "do_convert_rgb": true,
+ "do_normalize": true,
+ "do_rescale": true,
+ "do_resize": true,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_processor_type": "Qwen2VLImageProcessorFast",
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "merge_size": 2,
+ "patch_size": 16,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "size": {
+ "longest_edge": 16777216,
+ "shortest_edge": 65536
+ },
+ "temporal_patch_size": 2
+ },
+ "processor_class": "Qwen3VLProcessor",
+ "video_processor": {
+ "data_format": "channels_first",
+ "default_to_square": true,
+ "do_convert_rgb": true,
+ "do_normalize": true,
+ "do_rescale": true,
+ "do_resize": true,
+ "do_sample_frames": true,
+ "fps": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "max_frames": 768,
+ "merge_size": 2,
+ "min_frames": 4,
+ "patch_size": 16,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "return_metadata": false,
+ "size": {
+ "longest_edge": 25165824,
+ "shortest_edge": 4096
+ },
+ "temporal_patch_size": 2,
+ "video_processor_type": "Qwen3VLVideoProcessor"
+ }
+}
diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/tokenizer.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/tokenizer.json
new file mode 100644
index 0000000..67741b0
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4
+size 19989343
diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/tokenizer_config.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/tokenizer_config.json
new file mode 100644
index 0000000..a068e24
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/tokenizer_config.json
@@ -0,0 +1,32 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": true,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "processor_class": "Qwen3VLProcessor",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/video_preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/video_preprocessor_config.json
new file mode 100644
index 0000000..3ba673a
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/video_preprocessor_config.json
@@ -0,0 +1,21 @@
+{
+ "size": {
+ "longest_edge": 25165824,
+ "shortest_edge": 4096
+ },
+ "patch_size": 16,
+ "temporal_patch_size": 2,
+ "merge_size": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "processor_class": "Qwen3VLProcessor",
+ "video_processor_type": "Qwen3VLVideoProcessor"
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/vocab.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/vocab.json
new file mode 100644
index 0000000..d32f7ed
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/vocab.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ce99b4cb2983d118806ce0a8b777a35b093e2000a503ebde25853284c9dfa003
+size 6722759
diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/.gitattributes b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/.gitattributes
new file mode 100644
index 0000000..52373fe
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/.gitattributes
@@ -0,0 +1,36 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/README.md b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/README.md
new file mode 100644
index 0000000..5d96bdf
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/README.md
@@ -0,0 +1,75 @@
+---
+base_model: Qwen/Qwen3.5-4B
+library_name: mlx
+tags:
+ - mlx
+ - qwen3.5
+ - vision-language-model
+ - quantized
+ - 4bit
+license: apache-2.0
+---
+
+# Qwen3.5-4B-MLX-4bit
+
+This is a 4-bit quantized MLX version of [Qwen/Qwen3.5-4B](https://huggingface.co/Qwen/Qwen3.5-4B) for Apple Silicon.
+
+## Model Details
+
+- **Original Model:** [Qwen/Qwen3.5-4B](https://huggingface.co/Qwen/Qwen3.5-4B)
+- **Quantization:** 4-bit (5.347 bits per weight)
+- **Group Size:** 64
+- **Format:** MLX SafeTensors
+- **Framework:** [mlx-vlm](https://github.com/Blaizzy/mlx-vlm)
+- **Disk Size:** ~2.9G
+
+## Conversion Details
+
+This model was converted using `mlx-vlm` from the [`pc/fix-qwen35-predicate`](https://github.com/Blaizzy/mlx-vlm/tree/pc/fix-qwen35-predicate) branch, which includes fixes for Qwen3.5 model support (proper handling of MoE gate layers, `shared_expert_gate`, and `A_log` casting).
+
+**Conversion command:**
+```bash
+python3 -m mlx_vlm convert \
+ --hf-path "Qwen/Qwen3.5-4B" \
+ --mlx-path "./Qwen3.5-4B-MLX-4bit" \
+ -q --q-bits 4 --q-group-size 64
+```
+
+## Important Note
+
+A better, more optimized conversion may be available from **@Prince** ([@Blaizzy](https://huggingface.co/Blaizzy)) in the MLX VLM community. Check the [mlx-community](https://huggingface.co/mlx-community) organization for updated versions as official Qwen3.5 support is merged into the main `mlx-vlm` branch.
+
+## Related Models
+
+- **bf16 (full precision):** [mlx-community/Qwen3.5-4B-MLX-bf16](https://huggingface.co/mlx-community/Qwen3.5-4B-MLX-bf16)
+- **8-bit quantized:** [mlx-community/Qwen3.5-4B-MLX-8bit](https://huggingface.co/mlx-community/Qwen3.5-4B-MLX-8bit)
+- **Original:** [Qwen/Qwen3.5-4B](https://huggingface.co/Qwen/Qwen3.5-4B)
+
+## Usage
+
+```python
+from mlx_vlm import load, generate
+
+model, processor = load("mlx-community/Qwen3.5-4B-MLX-4bit")
+
+output = generate(
+ model,
+ processor,
+ prompt="Describe this image.",
+ image="path/to/image.jpg",
+ max_tokens=512
+)
+print(output)
+```
+
+**CLI:**
+```bash
+python3 -m mlx_vlm.generate \
+ --model mlx-community/Qwen3.5-4B-MLX-4bit \
+ --image path/to/image.jpg \
+ --prompt "Describe this image."
+```
+
+## License
+
+This model inherits the [Apache 2.0 license](https://huggingface.co/Qwen/Qwen3.5-4B) from the original Qwen model.
diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/chat_template.jinja b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/chat_template.jinja
new file mode 100644
index 0000000..a585dec
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n " }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n \n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n \n \n \n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n ' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith(' ')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if ' ' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split(' ')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n \n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n \n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- ' \n ' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n ' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n \n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/config.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/config.json
new file mode 100644
index 0000000..cb3e1a8
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/config.json
@@ -0,0 +1,114 @@
+{
+ "architectures": [
+ "Qwen3_5ForConditionalGeneration"
+ ],
+ "image_token_id": 248056,
+ "model_type": "qwen3_5",
+ "quantization": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine"
+ },
+ "quantization_config": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine"
+ },
+ "text_config": {
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "attn_output_gate": true,
+ "dtype": "bfloat16",
+ "eos_token_id": 248044,
+ "full_attention_interval": 4,
+ "head_dim": 256,
+ "hidden_act": "silu",
+ "hidden_size": 2560,
+ "initializer_range": 0.02,
+ "intermediate_size": 9216,
+ "layer_types": [
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention"
+ ],
+ "linear_conv_kernel_dim": 4,
+ "linear_key_head_dim": 128,
+ "linear_num_key_heads": 16,
+ "linear_num_value_heads": 32,
+ "linear_value_head_dim": 128,
+ "max_position_embeddings": 262144,
+ "mlp_only_layers": [],
+ "model_type": "qwen3_5_text",
+ "mtp_num_hidden_layers": 1,
+ "mtp_use_dedicated_embeddings": false,
+ "num_attention_heads": 16,
+ "num_hidden_layers": 32,
+ "num_key_value_heads": 4,
+ "rms_norm_eps": 1e-06,
+ "tie_word_embeddings": true,
+ "use_cache": true,
+ "vocab_size": 248320,
+ "mamba_ssm_dtype": "float32",
+ "rope_parameters": {
+ "mrope_interleaved": true,
+ "mrope_section": [
+ 11,
+ 11,
+ 10
+ ],
+ "rope_type": "default",
+ "rope_theta": 10000000,
+ "partial_rotary_factor": 0.25
+ }
+ },
+ "tie_word_embeddings": true,
+ "transformers_version": "4.57.0.dev0",
+ "video_token_id": 248057,
+ "vision_config": {
+ "deepstack_visual_indexes": [],
+ "depth": 24,
+ "hidden_act": "gelu_pytorch_tanh",
+ "hidden_size": 1024,
+ "in_channels": 3,
+ "initializer_range": 0.02,
+ "intermediate_size": 4096,
+ "model_type": "qwen3_5",
+ "num_heads": 16,
+ "num_position_embeddings": 2304,
+ "out_hidden_size": 2560,
+ "patch_size": 16,
+ "spatial_merge_size": 2,
+ "temporal_patch_size": 2
+ },
+ "vision_end_token_id": 248054,
+ "vision_start_token_id": 248053
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/model.safetensors b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/model.safetensors
new file mode 100644
index 0000000..7af3bae
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:5fb9acd0246866381cf8c5c354c6db1019f6498eec4ccb4f5edcc71ffeacb2db
+size 3034300695
diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/model.safetensors.index.json
new file mode 100644
index 0000000..40196ba
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/model.safetensors.index.json
@@ -0,0 +1,1228 @@
+{
+ "metadata": {
+ "total_size": 3034147328
+ },
+ "weight_map": {
+ "language_model.model.embed_tokens.biases": "model.safetensors",
+ "language_model.model.embed_tokens.scales": "model.safetensors",
+ "language_model.model.embed_tokens.weight": "model.safetensors",
+ "language_model.model.layers.0.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.1.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.10.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.13.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.14.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.17.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.18.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.20.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.21.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.22.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.25.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.26.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.27.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.29.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.31.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.5.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.6.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.9.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.A_log": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.conv1d.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.dt_bias": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.norm.weight": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.norm.weight": "model.safetensors",
+ "vision_tower.blocks.0.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.0.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.0.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.0.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.0.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.0.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.0.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.0.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.1.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.1.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.1.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.1.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.1.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.1.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.1.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.1.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.10.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.10.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.10.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.10.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.10.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.10.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.10.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.10.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.11.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.11.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.11.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.11.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.11.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.11.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.11.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.11.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.12.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.12.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.12.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.12.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.12.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.12.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.12.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.12.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.13.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.13.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.13.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.13.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.13.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.13.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.13.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.13.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.14.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.14.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.14.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.14.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.14.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.14.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.14.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.14.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.15.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.15.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.15.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.15.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.15.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.15.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.15.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.15.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.16.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.16.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.16.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.16.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.16.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.16.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.16.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.16.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.17.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.17.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.17.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.17.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.17.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.17.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.17.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.17.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.18.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.18.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.18.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.18.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.18.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.18.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.18.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.18.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.19.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.19.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.19.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.19.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.19.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.19.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.19.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.19.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.2.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.2.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.2.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.2.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.2.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.2.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.2.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.2.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.20.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.20.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.20.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.20.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.20.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.20.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.20.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.20.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.21.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.21.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.21.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.21.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.21.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.21.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.21.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.21.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.22.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.22.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.22.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.22.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.22.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.22.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.22.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.22.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.23.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.23.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.23.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.23.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.23.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.23.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.23.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.23.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.3.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.3.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.3.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.3.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.3.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.3.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.3.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.3.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.4.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.4.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.4.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.4.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.4.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.4.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.4.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.4.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.5.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.5.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.5.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.5.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.5.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.5.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.5.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.5.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.6.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.6.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.6.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.6.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.6.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.6.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.6.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.6.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.7.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.7.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.7.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.7.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.7.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.7.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.7.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.7.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.8.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.8.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.8.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.8.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.8.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.8.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.8.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.8.norm2.weight": "model.safetensors",
+ "vision_tower.blocks.9.attn.proj.bias": "model.safetensors",
+ "vision_tower.blocks.9.attn.proj.weight": "model.safetensors",
+ "vision_tower.blocks.9.attn.qkv.bias": "model.safetensors",
+ "vision_tower.blocks.9.attn.qkv.weight": "model.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc1.bias": "model.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc1.weight": "model.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc2.bias": "model.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc2.weight": "model.safetensors",
+ "vision_tower.blocks.9.norm1.bias": "model.safetensors",
+ "vision_tower.blocks.9.norm1.weight": "model.safetensors",
+ "vision_tower.blocks.9.norm2.bias": "model.safetensors",
+ "vision_tower.blocks.9.norm2.weight": "model.safetensors",
+ "vision_tower.merger.linear_fc1.bias": "model.safetensors",
+ "vision_tower.merger.linear_fc1.weight": "model.safetensors",
+ "vision_tower.merger.linear_fc2.bias": "model.safetensors",
+ "vision_tower.merger.linear_fc2.weight": "model.safetensors",
+ "vision_tower.merger.norm.bias": "model.safetensors",
+ "vision_tower.merger.norm.weight": "model.safetensors",
+ "vision_tower.patch_embed.proj.bias": "model.safetensors",
+ "vision_tower.patch_embed.proj.weight": "model.safetensors",
+ "vision_tower.pos_embed.weight": "model.safetensors"
+ }
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/preprocessor_config.json
new file mode 100644
index 0000000..2ea84a4
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/preprocessor_config.json
@@ -0,0 +1,21 @@
+{
+ "size": {
+ "longest_edge": 16777216,
+ "shortest_edge": 65536
+ },
+ "patch_size": 16,
+ "temporal_patch_size": 2,
+ "merge_size": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "processor_class": "Qwen3VLProcessor",
+ "image_processor_type": "Qwen2VLImageProcessorFast"
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/processor_config.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/processor_config.json
new file mode 100644
index 0000000..7ad6acd
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/processor_config.json
@@ -0,0 +1,63 @@
+{
+ "image_processor": {
+ "data_format": "channels_first",
+ "do_convert_rgb": true,
+ "do_normalize": true,
+ "do_rescale": true,
+ "do_resize": true,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_processor_type": "Qwen2VLImageProcessorFast",
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "merge_size": 2,
+ "patch_size": 16,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "size": {
+ "longest_edge": 16777216,
+ "shortest_edge": 65536
+ },
+ "temporal_patch_size": 2
+ },
+ "processor_class": "Qwen3VLProcessor",
+ "video_processor": {
+ "data_format": "channels_first",
+ "default_to_square": true,
+ "do_convert_rgb": true,
+ "do_normalize": true,
+ "do_rescale": true,
+ "do_resize": true,
+ "do_sample_frames": true,
+ "fps": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "max_frames": 768,
+ "merge_size": 2,
+ "min_frames": 4,
+ "patch_size": 16,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "return_metadata": false,
+ "size": {
+ "longest_edge": 25165824,
+ "shortest_edge": 4096
+ },
+ "temporal_patch_size": 2,
+ "video_processor_type": "Qwen3VLVideoProcessor"
+ }
+}
diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/tokenizer.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/tokenizer.json
new file mode 100644
index 0000000..67741b0
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4
+size 19989343
diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/tokenizer_config.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/tokenizer_config.json
new file mode 100644
index 0000000..a068e24
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/tokenizer_config.json
@@ -0,0 +1,32 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": true,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "processor_class": "Qwen3VLProcessor",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/video_preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/video_preprocessor_config.json
new file mode 100644
index 0000000..3ba673a
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/video_preprocessor_config.json
@@ -0,0 +1,21 @@
+{
+ "size": {
+ "longest_edge": 25165824,
+ "shortest_edge": 4096
+ },
+ "patch_size": 16,
+ "temporal_patch_size": 2,
+ "merge_size": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "processor_class": "Qwen3VLProcessor",
+ "video_processor_type": "Qwen3VLVideoProcessor"
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/vocab.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/vocab.json
new file mode 100644
index 0000000..d32f7ed
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/vocab.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ce99b4cb2983d118806ce0a8b777a35b093e2000a503ebde25853284c9dfa003
+size 6722759
diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/.gitattributes b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/.gitattributes
new file mode 100644
index 0000000..52373fe
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/.gitattributes
@@ -0,0 +1,36 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/README.md b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/README.md
new file mode 100644
index 0000000..5d6f034
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/README.md
@@ -0,0 +1,76 @@
+---
+base_model: Qwen/Qwen3.5-9B
+library_name: mlx
+pipeline_tag: image-text-to-text
+tags:
+ - mlx
+ - qwen3.5
+ - vision-language-model
+ - quantized
+ - 4bit
+license: apache-2.0
+---
+
+# Qwen3.5-9B-MLX-4bit
+
+This is a quantized MLX version of [Qwen/Qwen3.5-9B](https://huggingface.co/Qwen/Qwen3.5-9B) for Apple Silicon.
+
+## Model Details
+
+- **Original Model:** [Qwen/Qwen3.5-9B](https://huggingface.co/Qwen/Qwen3.5-9B)
+- **Quantization:** 4-bit (~5.059 bits per weight)
+- **Group Size:** 64
+- **Format:** MLX SafeTensors
+- **Framework:** [mlx-vlm](https://github.com/Blaizzy/mlx-vlm)
+
+## Conversion Details
+
+This model was converted using `mlx-vlm` with 4-bit quantization.
+
+**Conversion command:**
+```bash
+python3 -m mlx_vlm convert \
+ --hf-path "Qwen/Qwen3.5-9B" \
+ --mlx-path "./mlx_models/Qwen3.5-9B-MLX-4bit" \
+ -q --q-bits 4 --q-group-size 64
+```
+
+## Important Note
+
+A better, more optimized conversion may be available from **@Prince** ([@Blaizzy](https://huggingface.co/Blaizzy)) in the MLX VLM community. Check the [mlx-community](https://huggingface.co/mlx-community) organization for updated versions as official Qwen3.5 support is merged into the main `mlx-vlm` branch.
+
+## Usage
+
+```python
+from mlx_vlm import load, generate
+
+model, processor = load("mlx-community/Qwen3.5-9B-MLX-4bit")
+
+output = generate(
+ model,
+ processor,
+ prompt="Describe this image in detail",
+ image="path/to/image.jpg",
+ max_tokens=200
+)
+print(output)
+```
+
+Or from the command line:
+```bash
+mlx_vlm generate \
+ --model mlx-community/Qwen3.5-9B-MLX-4bit \
+ --prompt "Describe this image" \
+ --image path/to/image.jpg \
+ --max-tokens 200
+```
+
+## Performance
+
+- **Disk Size:** ~5.6 GB
+- Runs efficiently on Apple Silicon Macs (M1/M2/M3/M4)
+- Lower memory footprint compared to 8-bit quantization
+
+## License
+
+This model inherits the [Apache 2.0 license](https://huggingface.co/Qwen/Qwen3.5-9B/blob/main/LICENSE) from the original Qwen3.5-9B model.
diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/chat_template.jinja b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/chat_template.jinja
new file mode 100644
index 0000000..a585dec
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n " }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n \n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n \n \n \n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n ' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith(' ')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if ' ' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split(' ')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n \n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n \n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- ' \n ' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n ' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n \n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/config.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/config.json
new file mode 100644
index 0000000..0435ae3
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/config.json
@@ -0,0 +1,113 @@
+{
+ "architectures": [
+ "Qwen3_5ForConditionalGeneration"
+ ],
+ "image_token_id": 248056,
+ "model_type": "qwen3_5",
+ "quantization": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine"
+ },
+ "quantization_config": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine"
+ },
+ "text_config": {
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "attn_output_gate": true,
+ "dtype": "bfloat16",
+ "eos_token_id": 248044,
+ "full_attention_interval": 4,
+ "head_dim": 256,
+ "hidden_act": "silu",
+ "hidden_size": 4096,
+ "initializer_range": 0.02,
+ "intermediate_size": 12288,
+ "layer_types": [
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention"
+ ],
+ "linear_conv_kernel_dim": 4,
+ "linear_key_head_dim": 128,
+ "linear_num_key_heads": 16,
+ "linear_num_value_heads": 32,
+ "linear_value_head_dim": 128,
+ "max_position_embeddings": 262144,
+ "mlp_only_layers": [],
+ "model_type": "qwen3_5_text",
+ "mtp_num_hidden_layers": 1,
+ "mtp_use_dedicated_embeddings": false,
+ "num_attention_heads": 16,
+ "num_hidden_layers": 32,
+ "num_key_value_heads": 4,
+ "rms_norm_eps": 1e-06,
+ "use_cache": true,
+ "vocab_size": 248320,
+ "mamba_ssm_dtype": "float32",
+ "rope_parameters": {
+ "mrope_interleaved": true,
+ "mrope_section": [
+ 11,
+ 11,
+ 10
+ ],
+ "rope_type": "default",
+ "rope_theta": 10000000,
+ "partial_rotary_factor": 0.25
+ }
+ },
+ "tie_word_embeddings": false,
+ "transformers_version": "4.57.0.dev0",
+ "video_token_id": 248057,
+ "vision_config": {
+ "deepstack_visual_indexes": [],
+ "depth": 27,
+ "hidden_act": "gelu_pytorch_tanh",
+ "hidden_size": 1152,
+ "in_channels": 3,
+ "initializer_range": 0.02,
+ "intermediate_size": 4304,
+ "model_type": "qwen3_5",
+ "num_heads": 16,
+ "num_position_embeddings": 2304,
+ "out_hidden_size": 4096,
+ "patch_size": 16,
+ "spatial_merge_size": 2,
+ "temporal_patch_size": 2
+ },
+ "vision_end_token_id": 248054,
+ "vision_start_token_id": 248053
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model-00001-of-00002.safetensors b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model-00001-of-00002.safetensors
new file mode 100644
index 0000000..ddb369e
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model-00001-of-00002.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:a68b87558c6ef43f74c2bd63ce7e9092ceddc3101f3def0030774bae5f42aadd
+size 5349771222
diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model-00002-of-00002.safetensors b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model-00002-of-00002.safetensors
new file mode 100644
index 0000000..806973d
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model-00002-of-00002.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:b0a770bf8469c7f3f18756a0e0283f1c1174344a83e059a4e483f6af4907352d
+size 600449850
diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model.safetensors.index.json
new file mode 100644
index 0000000..d366fa5
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model.safetensors.index.json
@@ -0,0 +1,1267 @@
+{
+ "metadata": {
+ "total_size": 5950062560
+ },
+ "weight_map": {
+ "language_model.lm_head.biases": "model-00002-of-00002.safetensors",
+ "language_model.lm_head.scales": "model-00002-of-00002.safetensors",
+ "language_model.lm_head.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.embed_tokens.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.embed_tokens.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.embed_tokens.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.31.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.A_log": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.dt_bias": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.norm.weight": "model-00002-of-00002.safetensors",
+ "vision_tower.blocks.0.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.0.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.0.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.0.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.0.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.0.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.0.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.0.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.1.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.1.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.1.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.1.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.1.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.1.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.1.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.1.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.10.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.10.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.10.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.10.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.10.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.10.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.10.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.10.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.11.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.11.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.11.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.11.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.11.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.11.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.11.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.11.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.12.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.12.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.12.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.12.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.12.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.12.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.12.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.12.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.13.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.13.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.13.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.13.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.13.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.13.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.13.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.13.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.14.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.14.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.14.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.14.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.14.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.14.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.14.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.14.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.15.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.15.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.15.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.15.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.15.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.15.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.15.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.15.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.16.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.16.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.16.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.16.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.16.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.16.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.16.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.16.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.17.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.17.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.17.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.17.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.17.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.17.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.17.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.17.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.18.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.18.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.18.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.18.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.18.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.18.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.18.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.18.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.19.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.19.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.19.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.19.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.19.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.19.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.19.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.19.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.2.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.2.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.2.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.2.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.2.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.2.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.2.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.2.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.20.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.20.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.20.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.20.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.20.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.20.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.20.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.20.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.21.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.21.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.21.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.21.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.21.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.21.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.21.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.21.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.22.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.22.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.22.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.22.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.22.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.22.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.22.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.22.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.23.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.23.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.23.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.23.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.23.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.23.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.23.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.23.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.24.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.24.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.24.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.24.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.24.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.24.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.24.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.24.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.24.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.24.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.24.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.24.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.25.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.25.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.25.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.25.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.25.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.25.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.25.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.25.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.25.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.25.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.25.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.25.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.26.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.26.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.26.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.26.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.26.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.26.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.26.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.26.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.26.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.26.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.26.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.26.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.3.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.3.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.3.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.3.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.3.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.3.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.3.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.3.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.4.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.4.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.4.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.4.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.4.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.4.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.4.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.4.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.5.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.5.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.5.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.5.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.5.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.5.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.5.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.5.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.6.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.6.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.6.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.6.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.6.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.6.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.6.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.6.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.7.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.7.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.7.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.7.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.7.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.7.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.7.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.7.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.8.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.8.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.8.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.8.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.8.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.8.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.8.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.8.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.9.attn.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.9.attn.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.9.attn.qkv.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.9.attn.qkv.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.9.norm1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.9.norm1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.9.norm2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.blocks.9.norm2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.merger.linear_fc1.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.merger.linear_fc1.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.merger.linear_fc2.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.merger.linear_fc2.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.merger.norm.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.merger.norm.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.patch_embed.proj.bias": "model-00001-of-00002.safetensors",
+ "vision_tower.patch_embed.proj.weight": "model-00001-of-00002.safetensors",
+ "vision_tower.pos_embed.weight": "model-00001-of-00002.safetensors"
+ }
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/preprocessor_config.json
new file mode 100644
index 0000000..2ea84a4
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/preprocessor_config.json
@@ -0,0 +1,21 @@
+{
+ "size": {
+ "longest_edge": 16777216,
+ "shortest_edge": 65536
+ },
+ "patch_size": 16,
+ "temporal_patch_size": 2,
+ "merge_size": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "processor_class": "Qwen3VLProcessor",
+ "image_processor_type": "Qwen2VLImageProcessorFast"
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/processor_config.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/processor_config.json
new file mode 100644
index 0000000..7ad6acd
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/processor_config.json
@@ -0,0 +1,63 @@
+{
+ "image_processor": {
+ "data_format": "channels_first",
+ "do_convert_rgb": true,
+ "do_normalize": true,
+ "do_rescale": true,
+ "do_resize": true,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_processor_type": "Qwen2VLImageProcessorFast",
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "merge_size": 2,
+ "patch_size": 16,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "size": {
+ "longest_edge": 16777216,
+ "shortest_edge": 65536
+ },
+ "temporal_patch_size": 2
+ },
+ "processor_class": "Qwen3VLProcessor",
+ "video_processor": {
+ "data_format": "channels_first",
+ "default_to_square": true,
+ "do_convert_rgb": true,
+ "do_normalize": true,
+ "do_rescale": true,
+ "do_resize": true,
+ "do_sample_frames": true,
+ "fps": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "max_frames": 768,
+ "merge_size": 2,
+ "min_frames": 4,
+ "patch_size": 16,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "return_metadata": false,
+ "size": {
+ "longest_edge": 25165824,
+ "shortest_edge": 4096
+ },
+ "temporal_patch_size": 2,
+ "video_processor_type": "Qwen3VLVideoProcessor"
+ }
+}
diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/tokenizer.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/tokenizer.json
new file mode 100644
index 0000000..67741b0
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4
+size 19989343
diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/tokenizer_config.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/tokenizer_config.json
new file mode 100644
index 0000000..a068e24
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/tokenizer_config.json
@@ -0,0 +1,32 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": true,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "processor_class": "Qwen3VLProcessor",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/video_preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/video_preprocessor_config.json
new file mode 100644
index 0000000..3ba673a
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/video_preprocessor_config.json
@@ -0,0 +1,21 @@
+{
+ "size": {
+ "longest_edge": 25165824,
+ "shortest_edge": 4096
+ },
+ "patch_size": 16,
+ "temporal_patch_size": 2,
+ "merge_size": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "processor_class": "Qwen3VLProcessor",
+ "video_processor_type": "Qwen3VLVideoProcessor"
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/vocab.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/vocab.json
new file mode 100644
index 0000000..d32f7ed
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/vocab.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ce99b4cb2983d118806ce0a8b777a35b093e2000a503ebde25853284c9dfa003
+size 6722759
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/.gitattributes b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/.gitattributes
new file mode 100644
index 0000000..52373fe
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/.gitattributes
@@ -0,0 +1,36 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/README.md b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/README.md
new file mode 100644
index 0000000..6bb7630
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/README.md
@@ -0,0 +1,25 @@
+---
+library_name: mlx
+license: apache-2.0
+license_link: https://huggingface.co/Qwen/Qwen3.6-35B-A3B/blob/main/LICENSE
+pipeline_tag: image-text-to-text
+tags:
+- mlx
+base_model: Qwen/Qwen3.6-35B-A3B
+---
+
+# mlx-community/Qwen3.6-35B-A3B-4bit
+
+This model was converted to MLX format from [`Qwen/Qwen3.6-35B-A3B`](https://huggingface.co/Qwen/Qwen3.6-35B-A3B)
+using mlx-vlm version **0.4.4**.
+Refer to the [original model card](https://huggingface.co/Qwen/Qwen3.6-35B-A3B) for more details on the model.
+
+## Use with mlx
+
+```bash
+pip install -U mlx-vlm
+```
+
+```bash
+python -m mlx_vlm.generate --model mlx-community/Qwen3.6-35B-A3B-4bit --max-tokens 100 --temperature 0.0 --prompt "Describe this image." --image
+```
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/chat_template.jinja b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/chat_template.jinja
new file mode 100644
index 0000000..a8755d8
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n " }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n \n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n \n \n \n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n ' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith(' ')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if ' ' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split(' ')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if (preserve_thinking is defined and preserve_thinking is true) or (loop.index0 > ns.last_query_index) %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n \n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | string if args_value is string else args_value | tojson | safe %}
+ {{- args_value }}
+ {{- '\n \n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- ' \n ' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n ' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n \n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/config.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/config.json
new file mode 100644
index 0000000..e3a2334
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/config.json
@@ -0,0 +1,773 @@
+{
+ "architectures": [
+ "Qwen3_5MoeForConditionalGeneration"
+ ],
+ "eos_token_id": [
+ 248046,
+ 248044
+ ],
+ "image_token_id": 248056,
+ "model_type": "qwen3_5_moe",
+ "quantization": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine",
+ "language_model.model.layers.0.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.0.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.1.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.1.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.2.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.2.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.3.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.3.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.4.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.4.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.5.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.5.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.6.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.6.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.7.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.7.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.8.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.8.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.9.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.9.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.10.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.10.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.11.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.11.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.12.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.12.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.13.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.13.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.14.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.14.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.15.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.15.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.16.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.16.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.17.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.17.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.18.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.18.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.19.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.19.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.20.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.20.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.21.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.21.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.22.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.22.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.23.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.23.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.24.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.24.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.25.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.25.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.26.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.26.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.27.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.27.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.28.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.28.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.29.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.29.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.30.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.30.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.31.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.31.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.32.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.32.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.33.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.33.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.34.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.34.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.35.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.35.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.36.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.36.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.37.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.37.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.38.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.38.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.39.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.39.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ }
+ },
+ "quantization_config": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine",
+ "language_model.model.layers.0.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.0.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.1.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.1.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.2.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.2.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.3.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.3.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.4.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.4.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.5.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.5.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.6.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.6.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.7.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.7.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.8.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.8.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.9.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.9.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.10.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.10.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.11.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.11.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.12.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.12.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.13.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.13.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.14.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.14.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.15.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.15.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.16.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.16.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.17.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.17.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.18.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.18.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.19.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.19.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.20.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.20.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.21.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.21.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.22.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.22.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.23.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.23.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.24.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.24.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.25.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.25.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.26.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.26.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.27.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.27.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.28.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.28.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.29.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.29.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.30.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.30.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.31.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.31.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.32.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.32.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.33.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.33.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.34.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.34.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.35.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.35.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.36.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.36.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.37.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.37.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.38.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.38.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.39.mlp.gate": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.39.mlp.shared_expert_gate": {
+ "group_size": 64,
+ "bits": 8
+ }
+ },
+ "text_config": {
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "attn_output_gate": true,
+ "bos_token_id": 248044,
+ "dtype": "bfloat16",
+ "eos_token_id": 248044,
+ "full_attention_interval": 4,
+ "head_dim": 256,
+ "hidden_act": "silu",
+ "hidden_size": 2048,
+ "initializer_range": 0.02,
+ "layer_types": [
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention",
+ "linear_attention",
+ "linear_attention",
+ "linear_attention",
+ "full_attention"
+ ],
+ "linear_conv_kernel_dim": 4,
+ "linear_key_head_dim": 128,
+ "linear_num_key_heads": 16,
+ "linear_num_value_heads": 32,
+ "linear_value_head_dim": 128,
+ "mamba_ssm_dtype": "float32",
+ "max_position_embeddings": 262144,
+ "model_type": "qwen3_5_moe_text",
+ "moe_intermediate_size": 512,
+ "mtp_num_hidden_layers": 1,
+ "mtp_use_dedicated_embeddings": false,
+ "num_attention_heads": 16,
+ "num_experts": 256,
+ "num_experts_per_tok": 8,
+ "num_hidden_layers": 40,
+ "num_key_value_heads": 2,
+ "output_router_logits": false,
+ "pad_token_id": null,
+ "partial_rotary_factor": 0.25,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "mrope_interleaved": true,
+ "mrope_section": [
+ 11,
+ 11,
+ 10
+ ],
+ "partial_rotary_factor": 0.25,
+ "rope_theta": 10000000,
+ "rope_type": "default"
+ },
+ "router_aux_loss_coef": 0.001,
+ "shared_expert_intermediate_size": 512,
+ "tie_word_embeddings": false,
+ "use_cache": true,
+ "vocab_size": 248320
+ },
+ "tie_word_embeddings": false,
+ "transformers_version": "4.57.1",
+ "video_token_id": 248057,
+ "vision_config": {
+ "deepstack_visual_indexes": [],
+ "depth": 27,
+ "hidden_act": "gelu_pytorch_tanh",
+ "hidden_size": 1152,
+ "in_channels": 3,
+ "initializer_range": 0.02,
+ "intermediate_size": 4304,
+ "model_type": "qwen3_5_moe",
+ "num_heads": 16,
+ "num_position_embeddings": 2304,
+ "out_hidden_size": 2048,
+ "patch_size": 16,
+ "spatial_merge_size": 2,
+ "temporal_patch_size": 2
+ },
+ "vision_end_token_id": 248054,
+ "vision_start_token_id": 248053
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/configuration.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/configuration.json
new file mode 100644
index 0000000..d24dba9
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/configuration.json
@@ -0,0 +1 @@
+{"framework":"Pytorch","task":"visual-question-answering"}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/generation_config.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/generation_config.json
new file mode 100644
index 0000000..023756c
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/generation_config.json
@@ -0,0 +1,12 @@
+{
+ "bos_token_id": 248044,
+ "do_sample": true,
+ "eos_token_id": [
+ 248046,
+ 248044
+ ],
+ "pad_token_id": 248044,
+ "temperature": 1.0,
+ "top_k": 20,
+ "top_p": 0.95
+}
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00001-of-00004.safetensors b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00001-of-00004.safetensors
new file mode 100644
index 0000000..a2b31c0
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00001-of-00004.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:09f3e6ecb0b7af6e6a38bc8169a134c821b0924c2679b2bb8f4426ad38d032b8
+size 5288196018
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00002-of-00004.safetensors b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00002-of-00004.safetensors
new file mode 100644
index 0000000..6ef94e6
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00002-of-00004.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:31dcdb1c49eebdb1505bd14e3cb33f9cf900bd2546b638f2464694ae763a033f
+size 5368472749
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00003-of-00004.safetensors b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00003-of-00004.safetensors
new file mode 100644
index 0000000..3fc47ae
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00003-of-00004.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:3e66de06a1f03dade16a612a368cfce4a4c9caa4efd7d28185454384082cec03
+size 5368324139
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00004-of-00004.safetensors b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00004-of-00004.safetensors
new file mode 100644
index 0000000..6103cd4
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00004-of-00004.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:a5d0cf03519c26f8b506df6b0ba60526e5c08c8cea22d0c21ce92950e58a5422
+size 4377211365
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model.safetensors.index.json
new file mode 100644
index 0000000..f714d29
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model.safetensors.index.json
@@ -0,0 +1,2097 @@
+{
+ "metadata": {
+ "total_size": 20401929952
+ },
+ "weight_map": {
+ "language_model.lm_head.biases": "model-00004-of-00004.safetensors",
+ "language_model.lm_head.scales": "model-00004-of-00004.safetensors",
+ "language_model.lm_head.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.embed_tokens.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.embed_tokens.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.embed_tokens.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.A_log": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.dt_bias": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.norm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.A_log": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.dt_bias": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.norm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.A_log": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.A_log": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.A_log": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.A_log": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.A_log": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.A_log": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.A_log": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.A_log": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.dt_bias": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.norm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.A_log": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.A_log": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.A_log": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.A_log": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.A_log": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.A_log": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.A_log": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.A_log": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.A_log": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.input_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.gate.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.gate.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.gate.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.31.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.biases": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.scales": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+ "language_model.model.layers.32.input_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.A_log": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.in_proj_a.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.in_proj_a.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.in_proj_b.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.in_proj_b.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.in_proj_qkv.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.in_proj_qkv.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.in_proj_z.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.in_proj_z.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.out_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.out_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.linear_attn.out_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.32.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.input_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.A_log": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.in_proj_a.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.in_proj_a.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.in_proj_b.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.in_proj_b.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.in_proj_qkv.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.in_proj_qkv.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.in_proj_z.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.in_proj_z.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.out_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.out_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.linear_attn.out_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.33.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.input_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.A_log": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.in_proj_a.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.in_proj_a.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.in_proj_b.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.in_proj_b.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.in_proj_qkv.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.in_proj_qkv.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.in_proj_z.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.in_proj_z.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.out_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.out_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.linear_attn.out_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.34.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.input_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.self_attn.k_norm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.self_attn.k_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.self_attn.k_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.self_attn.k_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.self_attn.o_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.self_attn.o_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.self_attn.o_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.self_attn.q_norm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.self_attn.q_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.self_attn.q_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.self_attn.q_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.self_attn.v_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.self_attn.v_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.35.self_attn.v_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.input_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.A_log": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.in_proj_a.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.in_proj_a.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.in_proj_b.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.in_proj_b.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.in_proj_qkv.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.in_proj_qkv.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.in_proj_z.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.in_proj_z.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.out_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.out_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.linear_attn.out_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.36.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.input_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.A_log": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.in_proj_a.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.in_proj_a.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.in_proj_b.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.in_proj_b.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.in_proj_qkv.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.in_proj_qkv.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.in_proj_z.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.in_proj_z.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.out_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.out_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.linear_attn.out_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.37.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.input_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.A_log": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.dt_bias": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.in_proj_a.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.in_proj_a.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.in_proj_b.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.in_proj_b.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.in_proj_qkv.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.in_proj_qkv.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.in_proj_z.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.in_proj_z.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.norm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.out_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.out_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.linear_attn.out_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.38.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.input_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.self_attn.k_norm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.self_attn.k_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.self_attn.k_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.self_attn.k_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.self_attn.o_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.self_attn.o_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.self_attn.o_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.self_attn.q_norm.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.self_attn.q_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.self_attn.q_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.self_attn.q_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.self_attn.v_proj.biases": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.self_attn.v_proj.scales": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.39.self_attn.v_proj.weight": "model-00004-of-00004.safetensors",
+ "language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.A_log": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.dt_bias": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.norm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.A_log": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.dt_bias": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.norm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.input_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.A_log": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.dt_bias": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.norm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.A_log": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.dt_bias": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.norm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.gate.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.gate.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.gate.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+ "language_model.model.layers.9.input_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.A_log": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.layers.9.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+ "language_model.model.norm.weight": "model-00004-of-00004.safetensors",
+ "vision_tower.blocks.0.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.0.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.0.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.0.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.0.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.0.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.0.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.0.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.0.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.1.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.1.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.1.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.1.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.1.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.1.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.1.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.1.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.1.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.10.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.10.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.10.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.10.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.10.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.10.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.10.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.10.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.10.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.11.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.11.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.11.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.11.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.11.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.11.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.11.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.11.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.11.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.12.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.12.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.12.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.12.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.12.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.12.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.12.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.12.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.12.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.13.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.13.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.13.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.13.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.13.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.13.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.13.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.13.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.13.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.14.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.14.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.14.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.14.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.14.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.14.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.14.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.14.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.14.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.15.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.15.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.15.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.15.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.15.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.15.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.15.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.15.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.15.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.16.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.16.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.16.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.16.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.16.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.16.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.16.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.16.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.16.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.17.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.17.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.17.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.17.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.17.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.17.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.17.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.17.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.17.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.18.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.18.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.18.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.18.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.18.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.18.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.18.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.18.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.18.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.19.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.19.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.19.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.19.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.19.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.19.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.19.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.19.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.19.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.2.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.2.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.2.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.2.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.2.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.2.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.2.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.2.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.2.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.20.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.20.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.20.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.20.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.20.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.20.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.20.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.20.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.20.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.21.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.21.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.21.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.21.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.21.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.21.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.21.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.21.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.21.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.22.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.22.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.22.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.22.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.22.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.22.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.22.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.22.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.22.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.23.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.23.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.23.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.23.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.23.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.23.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.23.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.23.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.23.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.24.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.24.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.24.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.24.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.24.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.24.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.24.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.24.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.24.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.24.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.24.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.24.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.25.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.25.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.25.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.25.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.25.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.25.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.25.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.25.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.25.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.25.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.25.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.25.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.26.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.26.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.26.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.26.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.26.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.26.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.26.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.26.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.26.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.26.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.26.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.26.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.3.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.3.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.3.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.3.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.3.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.3.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.3.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.3.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.3.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.4.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.4.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.4.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.4.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.4.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.4.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.4.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.4.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.4.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.5.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.5.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.5.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.5.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.5.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.5.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.5.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.5.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.5.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.6.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.6.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.6.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.6.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.6.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.6.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.6.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.6.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.6.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.7.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.7.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.7.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.7.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.7.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.7.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.7.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.7.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.7.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.8.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.8.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.8.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.8.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.8.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.8.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.8.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.8.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.8.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.9.attn.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.9.attn.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.9.attn.qkv.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.9.attn.qkv.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.9.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.9.norm1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.9.norm1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.9.norm2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.blocks.9.norm2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.merger.linear_fc1.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.merger.linear_fc1.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.merger.linear_fc2.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.merger.linear_fc2.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.merger.norm.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.merger.norm.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.patch_embed.proj.bias": "model-00001-of-00004.safetensors",
+ "vision_tower.patch_embed.proj.weight": "model-00001-of-00004.safetensors",
+ "vision_tower.pos_embed.weight": "model-00001-of-00004.safetensors"
+ }
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/preprocessor_config.json
new file mode 100644
index 0000000..2ea84a4
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/preprocessor_config.json
@@ -0,0 +1,21 @@
+{
+ "size": {
+ "longest_edge": 16777216,
+ "shortest_edge": 65536
+ },
+ "patch_size": 16,
+ "temporal_patch_size": 2,
+ "merge_size": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "processor_class": "Qwen3VLProcessor",
+ "image_processor_type": "Qwen2VLImageProcessorFast"
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/processor_config.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/processor_config.json
new file mode 100644
index 0000000..a3be3e7
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/processor_config.json
@@ -0,0 +1,64 @@
+{
+ "image_processor": {
+ "do_convert_rgb": true,
+ "do_normalize": true,
+ "do_rescale": true,
+ "do_resize": true,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_processor_type": "Qwen2VLImageProcessor",
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "max_pixels": 16777216,
+ "merge_size": 2,
+ "min_pixels": 65536,
+ "patch_size": 16,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "size": {
+ "longest_edge": 16777216,
+ "shortest_edge": 65536
+ },
+ "temporal_patch_size": 2
+ },
+ "processor_class": "Qwen3VLProcessor",
+ "video_processor": {
+ "data_format": "channels_first",
+ "default_to_square": true,
+ "do_convert_rgb": true,
+ "do_normalize": true,
+ "do_rescale": true,
+ "do_resize": true,
+ "do_sample_frames": true,
+ "fps": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "max_frames": 768,
+ "merge_size": 2,
+ "min_frames": 4,
+ "patch_size": 16,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "return_metadata": false,
+ "size": {
+ "longest_edge": 25165824,
+ "shortest_edge": 4096
+ },
+ "temporal_patch_size": 2,
+ "video_processor_type": "Qwen3VLVideoProcessor"
+ }
+}
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/tokenizer.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/tokenizer.json
new file mode 100644
index 0000000..67741b0
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4
+size 19989343
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/tokenizer_config.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/tokenizer_config.json
new file mode 100644
index 0000000..a068e24
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/tokenizer_config.json
@@ -0,0 +1,32 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": true,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "processor_class": "Qwen3VLProcessor",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/video_preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/video_preprocessor_config.json
new file mode 100644
index 0000000..3ba673a
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/video_preprocessor_config.json
@@ -0,0 +1,21 @@
+{
+ "size": {
+ "longest_edge": 25165824,
+ "shortest_edge": 4096
+ },
+ "patch_size": 16,
+ "temporal_patch_size": 2,
+ "merge_size": 2,
+ "image_mean": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "image_std": [
+ 0.5,
+ 0.5,
+ 0.5
+ ],
+ "processor_class": "Qwen3VLProcessor",
+ "video_processor_type": "Qwen3VLVideoProcessor"
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/vocab.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/vocab.json
new file mode 100644
index 0000000..d32f7ed
--- /dev/null
+++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/vocab.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ce99b4cb2983d118806ce0a8b777a35b093e2000a503ebde25853284c9dfa003
+size 6722759
diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/.gitattributes b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/.gitattributes
new file mode 100644
index 0000000..52373fe
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/.gitattributes
@@ -0,0 +1,36 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/README.md b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/README.md
new file mode 100644
index 0000000..e9f0bd2
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/README.md
@@ -0,0 +1,7 @@
+---
+language: en
+pipeline_tag: image-text-to-text
+tags:
+- mlx
+library_name: mlx
+---
diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/chat_template.jinja b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/chat_template.jinja
new file mode 100644
index 0000000..e61bbfe
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/chat_template.jinja
@@ -0,0 +1,363 @@
+{%- macro format_parameters(properties, required, filter_keys=false) -%}
+ {%- set standard_keys = ['description', 'type', 'properties', 'required', 'nullable'] -%}
+ {%- set ns = namespace(found_first=false) -%}
+ {%- for key, value in properties | dictsort -%}
+ {%- set add_comma = false -%}
+ {%- if not filter_keys or key not in standard_keys -%}
+ {%- if ns.found_first %},{% endif -%}
+ {%- set ns.found_first = true -%}
+ {{ key }}:{
+ {%- if value['description'] -%}
+ description:<|"|>{{ value['description'] }}<|"|>
+ {%- set add_comma = true -%}
+ {%- endif -%}
+ {%- if value['type'] | upper == 'STRING' -%}
+ {%- if value['enum'] -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ enum:{{ format_argument(value['enum']) }}
+ {%- endif -%}
+ {%- elif value['type'] | upper == 'ARRAY' -%}
+ {%- if value['items'] is mapping and value['items'] -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ items:{
+ {%- set ns_items = namespace(found_first=false) -%}
+ {%- for item_key, item_value in value['items'] | dictsort -%}
+ {%- if item_value is not none -%}
+ {%- if ns_items.found_first %},{% endif -%}
+ {%- set ns_items.found_first = true -%}
+ {%- if item_key == 'properties' -%}
+ properties:{
+ {%- if item_value is mapping -%}
+ {{- format_parameters(item_value, value['items']['required'] | default([])) -}}
+ {%- endif -%}
+ }
+ {%- elif item_key == 'required' -%}
+ required:[
+ {%- for req_item in item_value -%}
+ <|"|>{{- req_item -}}<|"|>
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ ]
+ {%- elif item_key == 'type' -%}
+ {%- if item_value is string -%}
+ type:{{ format_argument(item_value | upper) }}
+ {%- else -%}
+ type:{{ format_argument(item_value | map('upper') | list) }}
+ {%- endif -%}
+ {%- else -%}
+ {{ item_key }}:{{ format_argument(item_value) }}
+ {%- endif -%}
+ {%- endif -%}
+ {%- endfor -%}
+ }
+ {%- endif -%}
+ {%- endif -%}
+ {%- if value['nullable'] %}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ nullable:true
+ {%- endif -%}
+ {%- if value['type'] | upper == 'OBJECT' -%}
+ {%- if value['properties'] is defined and value['properties'] is mapping -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ properties:{
+ {{- format_parameters(value['properties'], value['required'] | default([])) -}}
+ }
+ {%- elif value is mapping -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ properties:{
+ {{- format_parameters(value, value['required'] | default([]), filter_keys=true) -}}
+ }
+ {%- endif -%}
+ {%- if value['required'] -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ required:[
+ {%- for item in value['required'] | default([]) -%}
+ <|"|>{{- item -}}<|"|>
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ ]
+ {%- endif -%}
+ {%- endif -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ type:<|"|>{{ value['type'] | upper }}<|"|>}
+ {%- endif -%}
+ {%- endfor -%}
+{%- endmacro -%}
+{%- macro format_function_declaration(tool_data) -%}
+ declaration:{{- tool_data['function']['name'] -}}{description:<|"|>{{- tool_data['function']['description'] -}}<|"|>
+ {%- set params = tool_data['function']['parameters'] -%}
+ {%- if params -%}
+ ,parameters:{
+ {%- if params['properties'] -%}
+ properties:{ {{- format_parameters(params['properties'], params['required']) -}} },
+ {%- endif -%}
+ {%- if params['required'] -%}
+ required:[
+ {%- for item in params['required'] -%}
+ <|"|>{{- item -}}<|"|>
+ {{- ',' if not loop.last -}}
+ {%- endfor -%}
+ ],
+ {%- endif -%}
+ {%- if params['type'] -%}
+ type:<|"|>{{- params['type'] | upper -}}<|"|>}
+ {%- endif -%}
+ {%- endif -%}
+ {%- if 'response' in tool_data['function'] -%}
+ {%- set response_declaration = tool_data['function']['response'] -%}
+ ,response:{
+ {%- if response_declaration['description'] -%}
+ description:<|"|>{{- response_declaration['description'] -}}<|"|>,
+ {%- endif -%}
+ {%- if response_declaration['type'] | upper == 'OBJECT' -%}
+ type:<|"|>{{- response_declaration['type'] | upper -}}<|"|>}
+ {%- endif -%}
+ {%- endif -%}
+ }
+{%- endmacro -%}
+{%- macro format_argument(argument, escape_keys=True) -%}
+ {%- if argument is string -%}
+ {{- '<|"|>' + argument + '<|"|>' -}}
+ {%- elif argument is boolean -%}
+ {{- 'true' if argument else 'false' -}}
+ {%- elif argument is mapping -%}
+ {{- '{' -}}
+ {%- set ns = namespace(found_first=false) -%}
+ {%- for key, value in argument | dictsort -%}
+ {%- if ns.found_first %},{% endif -%}
+ {%- set ns.found_first = true -%}
+ {%- if escape_keys -%}
+ {{- '<|"|>' + key + '<|"|>' -}}
+ {%- else -%}
+ {{- key -}}
+ {%- endif -%}
+ :{{- format_argument(value, escape_keys=escape_keys) -}}
+ {%- endfor -%}
+ {{- '}' -}}
+ {%- elif argument is sequence -%}
+ {{- '[' -}}
+ {%- for item in argument -%}
+ {{- format_argument(item, escape_keys=escape_keys) -}}
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ {{- ']' -}}
+ {%- else -%}
+ {{- argument -}}
+ {%- endif -%}
+{%- endmacro -%}
+{%- macro strip_thinking(text) -%}
+ {%- set ns = namespace(result='') -%}
+ {%- for part in text.split('') -%}
+ {%- if '<|channel>' in part -%}
+ {%- set ns.result = ns.result + part.split('<|channel>')[0] -%}
+ {%- else -%}
+ {%- set ns.result = ns.result + part -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {{- ns.result | trim -}}
+{%- endmacro -%}
+
+{%- macro format_tool_response_block(tool_name, response) -%}
+ {{- '<|tool_response>' -}}
+ {%- if response is mapping -%}
+ {{- 'response:' + tool_name + '{' -}}
+ {%- for key, value in response | dictsort -%}
+ {{- key -}}:{{- format_argument(value, escape_keys=False) -}}
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ {{- '}' -}}
+ {%- else -%}
+ {{- 'response:' + tool_name + '{value:' + format_argument(response, escape_keys=False) + '}' -}}
+ {%- endif -%}
+ {{- '' -}}
+{%- endmacro -%}
+
+{%- set ns = namespace(prev_message_type=None) -%}
+{%- set loop_messages = messages -%}
+{{- bos_token -}}
+{#- Handle System/Tool Definitions Block -#}
+{%- if (enable_thinking is defined and enable_thinking) or tools or messages[0]['role'] in ['system', 'developer'] -%}
+ {{- '<|turn>system\n' -}}
+ {#- Inject Thinking token at the very top of the FIRST system turn -#}
+ {%- if enable_thinking is defined and enable_thinking -%}
+ {{- '<|think|>\n' -}}
+ {%- set ns.prev_message_type = 'think' -%}
+ {%- endif -%}
+ {%- if messages[0]['role'] in ['system', 'developer'] -%}
+ {%- if messages[0]['content'] is string -%}
+ {{- messages[0]['content'] | trim -}}
+ {%- elif messages[0]['content'] is sequence -%}
+ {%- for item in messages[0]['content'] -%}
+ {{- item['text'] | trim + ' '-}}
+ {%- endfor -%}
+ {%- endif -%}
+ {%- set loop_messages = messages[1:] -%}
+ {%- endif -%}
+ {%- if tools -%}
+ {%- for tool in tools %}
+ {{- '<|tool>' -}}
+ {{- format_function_declaration(tool) | trim -}}
+ {{- '' -}}
+ {%- endfor %}
+ {%- set ns.prev_message_type = 'tool' -%}
+ {%- endif -%}
+ {{- '\n' -}}
+{%- endif %}
+
+{#- Pre-scan: find last user message index for reasoning guard -#}
+{%- set ns_turn = namespace(last_user_idx=-1) -%}
+{%- for i in range(loop_messages | length) -%}
+ {%- if loop_messages[i]['role'] == 'user' -%}
+ {%- set ns_turn.last_user_idx = i -%}
+ {%- endif -%}
+{%- endfor -%}
+
+{#- Loop through messages -#}
+{%- for message in loop_messages -%}
+ {%- if message['role'] != 'tool' -%}
+ {%- set ns.prev_message_type = None -%}
+ {%- set role = 'model' if message['role'] == 'assistant' else message['role'] -%}
+ {#- Detect continuation: suppress duplicate <|turn>model when previous non-tool message was also assistant -#}
+ {%- set prev_nt = namespace(role=None, found=false) -%}
+ {%- if loop.index0 > 0 -%}
+ {%- for j in range(loop.index0 - 1, -1, -1) -%}
+ {%- if not prev_nt.found -%}
+ {%- if loop_messages[j]['role'] != 'tool' -%}
+ {%- set prev_nt.role = loop_messages[j]['role'] -%}
+ {%- set prev_nt.found = true -%}
+ {%- endif -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- endif -%}
+ {%- set continue_same_model_turn = (role == 'model' and prev_nt.role == 'assistant') -%}
+ {%- if not continue_same_model_turn -%}
+ {{- '<|turn>' + role + '\n' }}
+ {%- endif -%}
+
+ {#- Render reasoning/reasoning_content as thinking channel -#}
+ {%- set thinking_text = message.get('reasoning') or message.get('reasoning_content') -%}
+ {%- if thinking_text and loop.index0 > ns_turn.last_user_idx and message.get('tool_calls') -%}
+ {{- '<|channel>thought\n' + thinking_text + '\n' -}}
+ {%- endif -%}
+
+ {%- if message['tool_calls'] -%}
+ {%- for tool_call in message['tool_calls'] -%}
+ {%- set function = tool_call['function'] -%}
+ {{- '<|tool_call>call:' + function['name'] + '{' -}}
+ {%- if function['arguments'] is mapping -%}
+ {%- set ns_args = namespace(found_first=false) -%}
+ {%- for key, value in function['arguments'] | dictsort -%}
+ {%- if ns_args.found_first %},{% endif -%}
+ {%- set ns_args.found_first = true -%}
+ {{- key -}}:{{- format_argument(value, escape_keys=False) -}}
+ {%- endfor -%}
+ {%- elif function['arguments'] is string -%}
+ {{- function['arguments'] -}}
+ {%- endif -%}
+ {{- '}' -}}
+ {%- endfor -%}
+ {%- set ns.prev_message_type = 'tool_call' -%}
+ {%- endif -%}
+
+ {%- set ns_tr_out = namespace(flag=false) -%}
+ {%- if message.get('tool_responses') -%}
+ {#- Legacy: tool_responses embedded on the assistant message (Google/Gemma native) -#}
+ {%- for tool_response in message['tool_responses'] -%}
+ {{- format_tool_response_block(tool_response['name'] | default('unknown'), tool_response['response']) -}}
+ {%- set ns_tr_out.flag = true -%}
+ {%- set ns.prev_message_type = 'tool_response' -%}
+ {%- endfor -%}
+ {%- elif message.get('tool_calls') -%}
+ {#- OpenAI Chat Completions: forward-scan consecutive role:tool messages -#}
+ {%- set ns_tool_scan = namespace(stopped=false) -%}
+ {%- for k in range(loop.index0 + 1, loop_messages | length) -%}
+ {%- if ns_tool_scan.stopped -%}
+ {%- elif loop_messages[k]['role'] != 'tool' -%}
+ {%- set ns_tool_scan.stopped = true -%}
+ {%- else -%}
+ {%- set follow = loop_messages[k] -%}
+ {#- Resolve tool_call_id to function name -#}
+ {%- set ns_tname = namespace(name=follow.get('name') | default('unknown')) -%}
+ {%- for tc in message['tool_calls'] -%}
+ {%- if tc.get('id') == follow.get('tool_call_id') -%}
+ {%- set ns_tname.name = tc['function']['name'] -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {#- Handle content as string or content-parts array -#}
+ {%- set tool_body = follow.get('content') -%}
+ {%- if tool_body is string -%}
+ {{- format_tool_response_block(ns_tname.name, tool_body) -}}
+ {%- elif tool_body is sequence and tool_body is not string -%}
+ {%- set ns_txt = namespace(s='') -%}
+ {%- for part in tool_body -%}
+ {%- if part.get('type') == 'text' -%}
+ {%- set ns_txt.s = ns_txt.s + (part.get('text') | default('')) -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {{- format_tool_response_block(ns_tname.name, ns_txt.s) -}}
+ {%- for part in tool_body -%}
+ {%- if part.get('type') == 'image' -%}
+ {{- '<|image|>' -}}
+ {%- elif part.get('type') == 'audio' -%}
+ {{- '<|audio|>' -}}
+ {%- elif part.get('type') == 'video' -%}
+ {{- '<|video|>' -}}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- else -%}
+ {{- format_tool_response_block(ns_tname.name, tool_body) -}}
+ {%- endif -%}
+ {%- set ns_tr_out.flag = true -%}
+ {%- set ns.prev_message_type = 'tool_response' -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- endif -%}
+
+ {%- set captured_content -%}
+ {%- if message['content'] is string -%}
+ {%- if role == 'model' -%}
+ {{- strip_thinking(message['content']) -}}
+ {%- else -%}
+ {{- message['content'] | trim -}}
+ {%- endif -%}
+ {%- elif message['content'] is sequence -%}
+ {%- for item in message['content'] -%}
+ {%- if item['type'] == 'text' -%}
+ {%- if role == 'model' -%}
+ {{- strip_thinking(item['text']) -}}
+ {%- else -%}
+ {{- item['text'] | trim -}}
+ {%- endif -%}
+ {%- elif item['type'] == 'image' -%}
+ {{- '<|image|>' -}}
+ {%- set ns.prev_message_type = 'image' -%}
+ {%- elif item['type'] == 'audio' -%}
+ {{- '<|audio|>' -}}
+ {%- set ns.prev_message_type = 'audio' -%}
+ {%- elif item['type'] == 'video' -%}
+ {{- '<|video|>' -}}
+ {%- set ns.prev_message_type = 'video' -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- endif -%}
+ {%- endset -%}
+
+ {{- captured_content -}}
+ {%- set has_content = captured_content | trim | length > 0 -%}
+
+ {%- if ns.prev_message_type == 'tool_call' and not ns_tr_out.flag -%}
+ {{- '<|tool_response>' -}}
+ {%- elif not (ns_tr_out.flag and not has_content) -%}
+ {{- '\n' -}}
+ {%- endif -%}
+ {%- endif -%}
+{%- endfor -%}
+
+{%- if add_generation_prompt -%}
+ {%- if ns.prev_message_type != 'tool_response' and ns.prev_message_type != 'tool_call' -%}
+ {{- '<|turn>model\n' -}}
+ {%- if not enable_thinking | default(false) -%}
+ {{- '<|channel>thought\n' -}}
+ {%- endif -%}
+ {%- endif -%}
+{%- endif -%}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/config.json b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/config.json
new file mode 100644
index 0000000..d70dc39
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/config.json
@@ -0,0 +1,183 @@
+{
+ "architectures": [
+ "Gemma4UnifiedForConditionalGeneration"
+ ],
+ "audio_config": {
+ "_name_or_path": "",
+ "architectures": null,
+ "audio_embed_dim": 640,
+ "audio_samples_per_token": 640,
+ "chunk_size_feed_forward": 0,
+ "dtype": null,
+ "hidden_size": 640,
+ "id2label": {
+ "0": "LABEL_0",
+ "1": "LABEL_1"
+ },
+ "initializer_range": 0.02,
+ "is_encoder_decoder": false,
+ "label2id": {
+ "LABEL_0": 0,
+ "LABEL_1": 1
+ },
+ "model_type": "gemma4_unified_audio",
+ "output_attentions": false,
+ "output_hidden_states": false,
+ "output_proj_dims": 640,
+ "problem_type": null,
+ "return_dict": true,
+ "rms_norm_eps": 1e-06
+ },
+ "audio_token_id": 258881,
+ "boa_token_id": 256000,
+ "boi_token_id": 255999,
+ "dtype": "bfloat16",
+ "eoa_token_index": 258883,
+ "eoi_token_id": 258882,
+ "eos_token_id": [
+ 1,
+ 106,
+ 50
+ ],
+ "image_token_id": 258880,
+ "initializer_range": 0.02,
+ "model_type": "gemma4_unified",
+ "quantization": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine"
+ },
+ "quantization_config": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine"
+ },
+ "text_config": {
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "attention_k_eq_v": true,
+ "bos_token_id": 2,
+ "enable_moe_block": false,
+ "eos_token_id": 1,
+ "final_logit_softcapping": 30.0,
+ "global_head_dim": 512,
+ "head_dim": 256,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 3840,
+ "hidden_size_per_layer_input": 0,
+ "initializer_range": 0.02,
+ "intermediate_size": 15360,
+ "layer_types": [
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 262144,
+ "model_type": "gemma4_unified_text",
+ "moe_intermediate_size": null,
+ "num_attention_heads": 16,
+ "num_experts": null,
+ "num_global_key_value_heads": 1,
+ "num_hidden_layers": 48,
+ "num_key_value_heads": 8,
+ "num_kv_shared_layers": 0,
+ "pad_token_id": 0,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "full_attention": {
+ "partial_rotary_factor": 0.25,
+ "rope_theta": 1000000.0,
+ "rope_type": "proportional"
+ },
+ "sliding_attention": {
+ "rope_theta": 10000.0,
+ "rope_type": "default"
+ }
+ },
+ "sliding_window": 1024,
+ "tie_word_embeddings": true,
+ "top_k_experts": null,
+ "use_bidirectional_attention": "vision",
+ "use_cache": true,
+ "use_double_wide_mlp": false,
+ "vocab_size": 262144,
+ "vocab_size_per_layer_input": 262144
+ },
+ "tie_word_embeddings": true,
+ "transformers_version": "5.10.0.dev0",
+ "video_token_id": 258884,
+ "vision_config": {
+ "_name_or_path": "",
+ "architectures": null,
+ "chunk_size_feed_forward": 0,
+ "dtype": null,
+ "id2label": {
+ "0": "LABEL_0",
+ "1": "LABEL_1"
+ },
+ "initializer_range": 0.02,
+ "is_encoder_decoder": false,
+ "label2id": {
+ "LABEL_0": 0,
+ "LABEL_1": 1
+ },
+ "mm_embed_dim": 3840,
+ "mm_posemb_size": 1120,
+ "model_patch_size": 48,
+ "model_type": "gemma4_unified_vision",
+ "num_soft_tokens": 280,
+ "output_attentions": false,
+ "output_hidden_states": false,
+ "output_proj_dims": 3840,
+ "patch_size": 16,
+ "pooling_kernel_size": 3,
+ "problem_type": null,
+ "return_dict": true,
+ "rms_norm_eps": 1e-06
+ }
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/generation_config.json b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/generation_config.json
new file mode 100644
index 0000000..d09dccf
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/generation_config.json
@@ -0,0 +1,18 @@
+{
+ "bos_token_id": 2,
+ "do_sample": true,
+ "eos_token_id": [
+ 1,
+ 106,
+ 50
+ ],
+ "pad_token_id": 0,
+ "suppress_tokens": [
+ 258883,
+ 258882
+ ],
+ "temperature": 1.0,
+ "top_k": 64,
+ "top_p": 0.95,
+ "transformers_version": "5.10.0.dev0"
+}
diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model-00001-of-00002.safetensors b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model-00001-of-00002.safetensors
new file mode 100644
index 0000000..4ee5d76
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model-00001-of-00002.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:0d58feed0c98a69c07317b4481aeae5ab2785f12a496ea96ab24c4842808de78
+size 5351756584
diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model-00002-of-00002.safetensors b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model-00002-of-00002.safetensors
new file mode 100644
index 0000000..37b5196
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model-00002-of-00002.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:5b00a1bcb596ce6e827b4cdea6ecf2a0f35bb01306eb87c1ea4b3bcde36c7755
+size 1389282927
diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model.safetensors.index.json
new file mode 100644
index 0000000..c50946c
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model.safetensors.index.json
@@ -0,0 +1,1348 @@
+{
+ "metadata": {
+ "total_size": 6740867168
+ },
+ "weight_map": {
+ "embed_audio.embedding_projection.biases": "model-00002-of-00002.safetensors",
+ "embed_audio.embedding_projection.scales": "model-00002-of-00002.safetensors",
+ "embed_audio.embedding_projection.weight": "model-00002-of-00002.safetensors",
+ "embed_vision.embedding_projection.biases": "model-00002-of-00002.safetensors",
+ "embed_vision.embedding_projection.scales": "model-00002-of-00002.safetensors",
+ "embed_vision.embedding_projection.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.embed_tokens.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.embed_tokens.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.embed_tokens.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.21.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.22.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.25.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.26.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.28.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.29.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.30.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.32.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.33.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.34.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.35.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.36.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.input_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.37.layer_scalar": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.37.mlp.down_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.37.mlp.down_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.37.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.37.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.mlp.up_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.37.mlp.up_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.37.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.37.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.37.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.37.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.37.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.37.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.38.input_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.layer_scalar": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.mlp.down_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.mlp.down_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.mlp.gate_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.mlp.gate_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.mlp.up_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.mlp.up_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.self_attn.k_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.self_attn.k_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.self_attn.o_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.self_attn.o_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.self_attn.q_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.self_attn.q_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.self_attn.v_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.self_attn.v_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.38.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.input_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.layer_scalar": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.mlp.down_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.mlp.down_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.mlp.gate_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.mlp.gate_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.mlp.up_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.mlp.up_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.self_attn.k_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.self_attn.k_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.self_attn.o_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.self_attn.o_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.self_attn.q_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.self_attn.q_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.self_attn.v_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.self_attn.v_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.39.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.40.input_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.layer_scalar": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.mlp.down_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.mlp.down_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.mlp.gate_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.mlp.gate_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.mlp.up_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.mlp.up_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.self_attn.k_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.self_attn.k_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.self_attn.o_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.self_attn.o_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.self_attn.q_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.self_attn.q_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.self_attn.v_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.self_attn.v_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.40.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.input_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.layer_scalar": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.mlp.down_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.mlp.down_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.mlp.gate_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.mlp.gate_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.mlp.up_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.mlp.up_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.self_attn.k_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.self_attn.k_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.self_attn.o_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.self_attn.o_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.self_attn.q_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.self_attn.q_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.41.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.input_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.layer_scalar": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.mlp.down_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.mlp.down_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.mlp.gate_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.mlp.gate_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.mlp.up_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.mlp.up_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.self_attn.k_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.self_attn.k_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.self_attn.o_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.self_attn.o_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.self_attn.q_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.self_attn.q_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.self_attn.v_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.self_attn.v_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.42.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.input_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.layer_scalar": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.mlp.down_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.mlp.down_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.mlp.gate_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.mlp.gate_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.mlp.up_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.mlp.up_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.self_attn.k_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.self_attn.k_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.self_attn.o_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.self_attn.o_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.self_attn.q_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.self_attn.q_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.self_attn.v_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.self_attn.v_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.43.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.input_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.layer_scalar": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.mlp.down_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.mlp.down_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.mlp.gate_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.mlp.gate_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.mlp.up_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.mlp.up_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.self_attn.k_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.self_attn.k_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.self_attn.o_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.self_attn.o_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.self_attn.q_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.self_attn.q_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.self_attn.v_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.self_attn.v_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.44.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.input_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.layer_scalar": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.mlp.down_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.mlp.down_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.mlp.gate_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.mlp.gate_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.mlp.up_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.mlp.up_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.self_attn.k_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.self_attn.k_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.self_attn.o_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.self_attn.o_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.self_attn.q_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.self_attn.q_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.self_attn.v_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.self_attn.v_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.45.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.input_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.layer_scalar": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.mlp.down_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.mlp.down_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.mlp.gate_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.mlp.gate_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.mlp.up_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.mlp.up_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.self_attn.k_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.self_attn.k_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.self_attn.o_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.self_attn.o_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.self_attn.q_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.self_attn.q_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.self_attn.v_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.self_attn.v_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.46.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.input_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.layer_scalar": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.mlp.down_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.mlp.down_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.mlp.gate_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.mlp.gate_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.mlp.up_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.mlp.up_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.self_attn.k_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.self_attn.k_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.self_attn.k_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.self_attn.o_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.self_attn.o_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.self_attn.q_norm.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.self_attn.q_proj.biases": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.self_attn.q_proj.scales": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.47.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+ "language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.layer_scalar": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.self_attn.k_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.self_attn.k_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.self_attn.k_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.self_attn.o_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.self_attn.o_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.self_attn.q_norm.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.self_attn.q_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.self_attn.q_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.self_attn.v_proj.biases": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.self_attn.v_proj.scales": "model-00001-of-00002.safetensors",
+ "language_model.model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+ "language_model.model.norm.weight": "model-00002-of-00002.safetensors",
+ "vision_embedder.patch_dense.bias": "model-00002-of-00002.safetensors",
+ "vision_embedder.patch_dense.biases": "model-00002-of-00002.safetensors",
+ "vision_embedder.patch_dense.scales": "model-00002-of-00002.safetensors",
+ "vision_embedder.patch_dense.weight": "model-00002-of-00002.safetensors",
+ "vision_embedder.patch_ln1.bias": "model-00002-of-00002.safetensors",
+ "vision_embedder.patch_ln1.weight": "model-00002-of-00002.safetensors",
+ "vision_embedder.patch_ln2.bias": "model-00002-of-00002.safetensors",
+ "vision_embedder.patch_ln2.weight": "model-00002-of-00002.safetensors",
+ "vision_embedder.pos_embedding": "model-00002-of-00002.safetensors",
+ "vision_embedder.pos_norm.bias": "model-00002-of-00002.safetensors",
+ "vision_embedder.pos_norm.weight": "model-00002-of-00002.safetensors"
+ }
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/processor_config.json b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/processor_config.json
new file mode 100644
index 0000000..62a14d5
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/processor_config.json
@@ -0,0 +1,40 @@
+{
+ "image_processor": {
+ "do_convert_rgb": true,
+ "do_normalize": false,
+ "do_rescale": true,
+ "do_resize": true,
+ "image_mean": [
+ 0.0,
+ 0.0,
+ 0.0
+ ],
+ "image_processor_type": "Gemma4UnifiedImageProcessor",
+ "image_std": [
+ 1.0,
+ 1.0,
+ 1.0
+ ],
+ "max_soft_tokens": 280,
+ "model_patch_size": 48,
+ "patch_size": 16,
+ "pooling_kernel_size": 3,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "size": {
+ "height": 224,
+ "width": 224
+ }
+ },
+ "processor_class": "Gemma4UnifiedProcessor",
+ "feature_extractor": {
+ "feature_extractor_type": "Gemma4UnifiedAudioFeatureExtractor",
+ "sampling_rate": 16000,
+ "num_mel_filters": 128,
+ "fft_length": 512,
+ "hop_length": 160,
+ "chunk_duration": 8.0,
+ "overlap_duration": 1.0
+ },
+ "audio_ms_per_token": 40
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/tokenizer.json b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/tokenizer.json
new file mode 100644
index 0000000..1ff9f3e
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:cc8d3a0ce36466ccc1278bf987df5f71db1719b9ca6b4118264f45cb627bfe0f
+size 32169626
diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/tokenizer_config.json b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/tokenizer_config.json
new file mode 100644
index 0000000..5c5c5b1
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/tokenizer_config.json
@@ -0,0 +1,95 @@
+{
+ "audio_token": "<|audio|>",
+ "backend": "tokenizers",
+ "boa_token": "<|audio>",
+ "boi_token": "<|image>",
+ "bos_token": "",
+ "eoa_token": "",
+ "eoc_token": "",
+ "eoi_token": "",
+ "eos_token": "",
+ "eot_token": "",
+ "escape_token": "<|\"|>",
+ "etc_token": "",
+ "etd_token": "",
+ "etr_token": "",
+ "extra_special_tokens": [
+ "<|video|>"
+ ],
+ "image_token": "<|image|>",
+ "is_local": true,
+ "mask_token": "",
+ "model_max_length": 1000000000000000019884624838656,
+ "model_specific_special_tokens": {
+ "audio_token": "<|audio|>",
+ "boa_token": "<|audio>",
+ "boi_token": "<|image>",
+ "eoa_token": "",
+ "eoc_token": "",
+ "eoi_token": "",
+ "eot_token": "",
+ "escape_token": "<|\"|>",
+ "etc_token": "",
+ "etd_token": "",
+ "etr_token": "",
+ "image_token": "<|image|>",
+ "soc_token": "<|channel>",
+ "sot_token": "<|turn>",
+ "stc_token": "<|tool_call>",
+ "std_token": "<|tool>",
+ "str_token": "<|tool_response>",
+ "think_token": "<|think|>"
+ },
+ "pad_token": "",
+ "padding_side": "left",
+ "processor_class": "Gemma4UnifiedProcessor",
+ "response_schema": {
+ "properties": {
+ "content": {
+ "type": "string"
+ },
+ "role": {
+ "const": "assistant"
+ },
+ "thinking": {
+ "type": "string"
+ },
+ "tool_calls": {
+ "items": {
+ "properties": {
+ "function": {
+ "properties": {
+ "arguments": {
+ "additionalProperties": {},
+ "type": "object",
+ "x-parser": "gemma4-tool-call"
+ },
+ "name": {
+ "type": "string"
+ }
+ },
+ "type": "object",
+ "x-regex": "call\\:(?P\\w+)(?P\\{.*\\})"
+ },
+ "type": {
+ "const": "function"
+ }
+ },
+ "type": "object"
+ },
+ "type": "array",
+ "x-regex-iterator": "<\\|tool_call>(.*?)"
+ }
+ },
+ "type": "object",
+ "x-regex": "(\\<\\|channel\\>thought\\n(?P.*?)\\)?(?P\\<\\|tool_call\\>.*\\)?(?P(?:(?!\\)(?!\\<\\|tool_response\\>).)+)?(?:\\|\\<\\|tool_response\\>)?"
+ },
+ "soc_token": "<|channel>",
+ "sot_token": "<|turn>",
+ "stc_token": "<|tool_call>",
+ "std_token": "<|tool>",
+ "str_token": "<|tool_response>",
+ "think_token": "<|think|>",
+ "tokenizer_class": "GemmaTokenizer",
+ "unk_token": ""
+}
diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/.gitattributes b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/.gitattributes
new file mode 100644
index 0000000..52373fe
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/.gitattributes
@@ -0,0 +1,36 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/README.md b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/README.md
new file mode 100644
index 0000000..2efe3f6
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/README.md
@@ -0,0 +1,25 @@
+---
+library_name: mlx
+license: apache-2.0
+license_link: https://ai.google.dev/gemma/docs/gemma_4_license
+pipeline_tag: image-text-to-text
+base_model: google/gemma-4-26b-a4b-it
+tags:
+- mlx
+---
+
+# mlx-community/gemma-4-26b-a4b-it-4bit
+
+This model was converted to MLX format from [`google/gemma-4-26b-a4b-it`](https://huggingface.co/google/gemma-4-26b-a4b-it)
+using mlx-vlm version **0.4.3**.
+Refer to the [original model card](https://huggingface.co/google/gemma-4-26b-a4b-it) for more details on the model.
+
+## Use with mlx
+
+```bash
+pip install -U mlx-vlm
+```
+
+```bash
+python -m mlx_vlm.generate --model mlx-community/gemma-4-26b-a4b-it-4bit --max-tokens 100 --temperature 0.0 --prompt "Describe this image." --image
+```
diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/chat_template.jinja b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/chat_template.jinja
new file mode 100644
index 0000000..e61bbfe
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/chat_template.jinja
@@ -0,0 +1,363 @@
+{%- macro format_parameters(properties, required, filter_keys=false) -%}
+ {%- set standard_keys = ['description', 'type', 'properties', 'required', 'nullable'] -%}
+ {%- set ns = namespace(found_first=false) -%}
+ {%- for key, value in properties | dictsort -%}
+ {%- set add_comma = false -%}
+ {%- if not filter_keys or key not in standard_keys -%}
+ {%- if ns.found_first %},{% endif -%}
+ {%- set ns.found_first = true -%}
+ {{ key }}:{
+ {%- if value['description'] -%}
+ description:<|"|>{{ value['description'] }}<|"|>
+ {%- set add_comma = true -%}
+ {%- endif -%}
+ {%- if value['type'] | upper == 'STRING' -%}
+ {%- if value['enum'] -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ enum:{{ format_argument(value['enum']) }}
+ {%- endif -%}
+ {%- elif value['type'] | upper == 'ARRAY' -%}
+ {%- if value['items'] is mapping and value['items'] -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ items:{
+ {%- set ns_items = namespace(found_first=false) -%}
+ {%- for item_key, item_value in value['items'] | dictsort -%}
+ {%- if item_value is not none -%}
+ {%- if ns_items.found_first %},{% endif -%}
+ {%- set ns_items.found_first = true -%}
+ {%- if item_key == 'properties' -%}
+ properties:{
+ {%- if item_value is mapping -%}
+ {{- format_parameters(item_value, value['items']['required'] | default([])) -}}
+ {%- endif -%}
+ }
+ {%- elif item_key == 'required' -%}
+ required:[
+ {%- for req_item in item_value -%}
+ <|"|>{{- req_item -}}<|"|>
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ ]
+ {%- elif item_key == 'type' -%}
+ {%- if item_value is string -%}
+ type:{{ format_argument(item_value | upper) }}
+ {%- else -%}
+ type:{{ format_argument(item_value | map('upper') | list) }}
+ {%- endif -%}
+ {%- else -%}
+ {{ item_key }}:{{ format_argument(item_value) }}
+ {%- endif -%}
+ {%- endif -%}
+ {%- endfor -%}
+ }
+ {%- endif -%}
+ {%- endif -%}
+ {%- if value['nullable'] %}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ nullable:true
+ {%- endif -%}
+ {%- if value['type'] | upper == 'OBJECT' -%}
+ {%- if value['properties'] is defined and value['properties'] is mapping -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ properties:{
+ {{- format_parameters(value['properties'], value['required'] | default([])) -}}
+ }
+ {%- elif value is mapping -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ properties:{
+ {{- format_parameters(value, value['required'] | default([]), filter_keys=true) -}}
+ }
+ {%- endif -%}
+ {%- if value['required'] -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ required:[
+ {%- for item in value['required'] | default([]) -%}
+ <|"|>{{- item -}}<|"|>
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ ]
+ {%- endif -%}
+ {%- endif -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ type:<|"|>{{ value['type'] | upper }}<|"|>}
+ {%- endif -%}
+ {%- endfor -%}
+{%- endmacro -%}
+{%- macro format_function_declaration(tool_data) -%}
+ declaration:{{- tool_data['function']['name'] -}}{description:<|"|>{{- tool_data['function']['description'] -}}<|"|>
+ {%- set params = tool_data['function']['parameters'] -%}
+ {%- if params -%}
+ ,parameters:{
+ {%- if params['properties'] -%}
+ properties:{ {{- format_parameters(params['properties'], params['required']) -}} },
+ {%- endif -%}
+ {%- if params['required'] -%}
+ required:[
+ {%- for item in params['required'] -%}
+ <|"|>{{- item -}}<|"|>
+ {{- ',' if not loop.last -}}
+ {%- endfor -%}
+ ],
+ {%- endif -%}
+ {%- if params['type'] -%}
+ type:<|"|>{{- params['type'] | upper -}}<|"|>}
+ {%- endif -%}
+ {%- endif -%}
+ {%- if 'response' in tool_data['function'] -%}
+ {%- set response_declaration = tool_data['function']['response'] -%}
+ ,response:{
+ {%- if response_declaration['description'] -%}
+ description:<|"|>{{- response_declaration['description'] -}}<|"|>,
+ {%- endif -%}
+ {%- if response_declaration['type'] | upper == 'OBJECT' -%}
+ type:<|"|>{{- response_declaration['type'] | upper -}}<|"|>}
+ {%- endif -%}
+ {%- endif -%}
+ }
+{%- endmacro -%}
+{%- macro format_argument(argument, escape_keys=True) -%}
+ {%- if argument is string -%}
+ {{- '<|"|>' + argument + '<|"|>' -}}
+ {%- elif argument is boolean -%}
+ {{- 'true' if argument else 'false' -}}
+ {%- elif argument is mapping -%}
+ {{- '{' -}}
+ {%- set ns = namespace(found_first=false) -%}
+ {%- for key, value in argument | dictsort -%}
+ {%- if ns.found_first %},{% endif -%}
+ {%- set ns.found_first = true -%}
+ {%- if escape_keys -%}
+ {{- '<|"|>' + key + '<|"|>' -}}
+ {%- else -%}
+ {{- key -}}
+ {%- endif -%}
+ :{{- format_argument(value, escape_keys=escape_keys) -}}
+ {%- endfor -%}
+ {{- '}' -}}
+ {%- elif argument is sequence -%}
+ {{- '[' -}}
+ {%- for item in argument -%}
+ {{- format_argument(item, escape_keys=escape_keys) -}}
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ {{- ']' -}}
+ {%- else -%}
+ {{- argument -}}
+ {%- endif -%}
+{%- endmacro -%}
+{%- macro strip_thinking(text) -%}
+ {%- set ns = namespace(result='') -%}
+ {%- for part in text.split('') -%}
+ {%- if '<|channel>' in part -%}
+ {%- set ns.result = ns.result + part.split('<|channel>')[0] -%}
+ {%- else -%}
+ {%- set ns.result = ns.result + part -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {{- ns.result | trim -}}
+{%- endmacro -%}
+
+{%- macro format_tool_response_block(tool_name, response) -%}
+ {{- '<|tool_response>' -}}
+ {%- if response is mapping -%}
+ {{- 'response:' + tool_name + '{' -}}
+ {%- for key, value in response | dictsort -%}
+ {{- key -}}:{{- format_argument(value, escape_keys=False) -}}
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ {{- '}' -}}
+ {%- else -%}
+ {{- 'response:' + tool_name + '{value:' + format_argument(response, escape_keys=False) + '}' -}}
+ {%- endif -%}
+ {{- '' -}}
+{%- endmacro -%}
+
+{%- set ns = namespace(prev_message_type=None) -%}
+{%- set loop_messages = messages -%}
+{{- bos_token -}}
+{#- Handle System/Tool Definitions Block -#}
+{%- if (enable_thinking is defined and enable_thinking) or tools or messages[0]['role'] in ['system', 'developer'] -%}
+ {{- '<|turn>system\n' -}}
+ {#- Inject Thinking token at the very top of the FIRST system turn -#}
+ {%- if enable_thinking is defined and enable_thinking -%}
+ {{- '<|think|>\n' -}}
+ {%- set ns.prev_message_type = 'think' -%}
+ {%- endif -%}
+ {%- if messages[0]['role'] in ['system', 'developer'] -%}
+ {%- if messages[0]['content'] is string -%}
+ {{- messages[0]['content'] | trim -}}
+ {%- elif messages[0]['content'] is sequence -%}
+ {%- for item in messages[0]['content'] -%}
+ {{- item['text'] | trim + ' '-}}
+ {%- endfor -%}
+ {%- endif -%}
+ {%- set loop_messages = messages[1:] -%}
+ {%- endif -%}
+ {%- if tools -%}
+ {%- for tool in tools %}
+ {{- '<|tool>' -}}
+ {{- format_function_declaration(tool) | trim -}}
+ {{- '' -}}
+ {%- endfor %}
+ {%- set ns.prev_message_type = 'tool' -%}
+ {%- endif -%}
+ {{- '\n' -}}
+{%- endif %}
+
+{#- Pre-scan: find last user message index for reasoning guard -#}
+{%- set ns_turn = namespace(last_user_idx=-1) -%}
+{%- for i in range(loop_messages | length) -%}
+ {%- if loop_messages[i]['role'] == 'user' -%}
+ {%- set ns_turn.last_user_idx = i -%}
+ {%- endif -%}
+{%- endfor -%}
+
+{#- Loop through messages -#}
+{%- for message in loop_messages -%}
+ {%- if message['role'] != 'tool' -%}
+ {%- set ns.prev_message_type = None -%}
+ {%- set role = 'model' if message['role'] == 'assistant' else message['role'] -%}
+ {#- Detect continuation: suppress duplicate <|turn>model when previous non-tool message was also assistant -#}
+ {%- set prev_nt = namespace(role=None, found=false) -%}
+ {%- if loop.index0 > 0 -%}
+ {%- for j in range(loop.index0 - 1, -1, -1) -%}
+ {%- if not prev_nt.found -%}
+ {%- if loop_messages[j]['role'] != 'tool' -%}
+ {%- set prev_nt.role = loop_messages[j]['role'] -%}
+ {%- set prev_nt.found = true -%}
+ {%- endif -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- endif -%}
+ {%- set continue_same_model_turn = (role == 'model' and prev_nt.role == 'assistant') -%}
+ {%- if not continue_same_model_turn -%}
+ {{- '<|turn>' + role + '\n' }}
+ {%- endif -%}
+
+ {#- Render reasoning/reasoning_content as thinking channel -#}
+ {%- set thinking_text = message.get('reasoning') or message.get('reasoning_content') -%}
+ {%- if thinking_text and loop.index0 > ns_turn.last_user_idx and message.get('tool_calls') -%}
+ {{- '<|channel>thought\n' + thinking_text + '\n' -}}
+ {%- endif -%}
+
+ {%- if message['tool_calls'] -%}
+ {%- for tool_call in message['tool_calls'] -%}
+ {%- set function = tool_call['function'] -%}
+ {{- '<|tool_call>call:' + function['name'] + '{' -}}
+ {%- if function['arguments'] is mapping -%}
+ {%- set ns_args = namespace(found_first=false) -%}
+ {%- for key, value in function['arguments'] | dictsort -%}
+ {%- if ns_args.found_first %},{% endif -%}
+ {%- set ns_args.found_first = true -%}
+ {{- key -}}:{{- format_argument(value, escape_keys=False) -}}
+ {%- endfor -%}
+ {%- elif function['arguments'] is string -%}
+ {{- function['arguments'] -}}
+ {%- endif -%}
+ {{- '}' -}}
+ {%- endfor -%}
+ {%- set ns.prev_message_type = 'tool_call' -%}
+ {%- endif -%}
+
+ {%- set ns_tr_out = namespace(flag=false) -%}
+ {%- if message.get('tool_responses') -%}
+ {#- Legacy: tool_responses embedded on the assistant message (Google/Gemma native) -#}
+ {%- for tool_response in message['tool_responses'] -%}
+ {{- format_tool_response_block(tool_response['name'] | default('unknown'), tool_response['response']) -}}
+ {%- set ns_tr_out.flag = true -%}
+ {%- set ns.prev_message_type = 'tool_response' -%}
+ {%- endfor -%}
+ {%- elif message.get('tool_calls') -%}
+ {#- OpenAI Chat Completions: forward-scan consecutive role:tool messages -#}
+ {%- set ns_tool_scan = namespace(stopped=false) -%}
+ {%- for k in range(loop.index0 + 1, loop_messages | length) -%}
+ {%- if ns_tool_scan.stopped -%}
+ {%- elif loop_messages[k]['role'] != 'tool' -%}
+ {%- set ns_tool_scan.stopped = true -%}
+ {%- else -%}
+ {%- set follow = loop_messages[k] -%}
+ {#- Resolve tool_call_id to function name -#}
+ {%- set ns_tname = namespace(name=follow.get('name') | default('unknown')) -%}
+ {%- for tc in message['tool_calls'] -%}
+ {%- if tc.get('id') == follow.get('tool_call_id') -%}
+ {%- set ns_tname.name = tc['function']['name'] -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {#- Handle content as string or content-parts array -#}
+ {%- set tool_body = follow.get('content') -%}
+ {%- if tool_body is string -%}
+ {{- format_tool_response_block(ns_tname.name, tool_body) -}}
+ {%- elif tool_body is sequence and tool_body is not string -%}
+ {%- set ns_txt = namespace(s='') -%}
+ {%- for part in tool_body -%}
+ {%- if part.get('type') == 'text' -%}
+ {%- set ns_txt.s = ns_txt.s + (part.get('text') | default('')) -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {{- format_tool_response_block(ns_tname.name, ns_txt.s) -}}
+ {%- for part in tool_body -%}
+ {%- if part.get('type') == 'image' -%}
+ {{- '<|image|>' -}}
+ {%- elif part.get('type') == 'audio' -%}
+ {{- '<|audio|>' -}}
+ {%- elif part.get('type') == 'video' -%}
+ {{- '<|video|>' -}}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- else -%}
+ {{- format_tool_response_block(ns_tname.name, tool_body) -}}
+ {%- endif -%}
+ {%- set ns_tr_out.flag = true -%}
+ {%- set ns.prev_message_type = 'tool_response' -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- endif -%}
+
+ {%- set captured_content -%}
+ {%- if message['content'] is string -%}
+ {%- if role == 'model' -%}
+ {{- strip_thinking(message['content']) -}}
+ {%- else -%}
+ {{- message['content'] | trim -}}
+ {%- endif -%}
+ {%- elif message['content'] is sequence -%}
+ {%- for item in message['content'] -%}
+ {%- if item['type'] == 'text' -%}
+ {%- if role == 'model' -%}
+ {{- strip_thinking(item['text']) -}}
+ {%- else -%}
+ {{- item['text'] | trim -}}
+ {%- endif -%}
+ {%- elif item['type'] == 'image' -%}
+ {{- '<|image|>' -}}
+ {%- set ns.prev_message_type = 'image' -%}
+ {%- elif item['type'] == 'audio' -%}
+ {{- '<|audio|>' -}}
+ {%- set ns.prev_message_type = 'audio' -%}
+ {%- elif item['type'] == 'video' -%}
+ {{- '<|video|>' -}}
+ {%- set ns.prev_message_type = 'video' -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- endif -%}
+ {%- endset -%}
+
+ {{- captured_content -}}
+ {%- set has_content = captured_content | trim | length > 0 -%}
+
+ {%- if ns.prev_message_type == 'tool_call' and not ns_tr_out.flag -%}
+ {{- '<|tool_response>' -}}
+ {%- elif not (ns_tr_out.flag and not has_content) -%}
+ {{- '\n' -}}
+ {%- endif -%}
+ {%- endif -%}
+{%- endfor -%}
+
+{%- if add_generation_prompt -%}
+ {%- if ns.prev_message_type != 'tool_response' and ns.prev_message_type != 'tool_call' -%}
+ {{- '<|turn>model\n' -}}
+ {%- if not enable_thinking | default(false) -%}
+ {{- '<|channel>thought\n' -}}
+ {%- endif -%}
+ {%- endif -%}
+{%- endif -%}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/config.json b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/config.json
new file mode 100644
index 0000000..b9fdfd6
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/config.json
@@ -0,0 +1,1117 @@
+{
+ "architectures": [
+ "Gemma4ForConditionalGeneration"
+ ],
+ "audio_config": null,
+ "audio_token_id": 258881,
+ "boa_token_id": 256000,
+ "boi_token_id": 255999,
+ "dtype": "bfloat16",
+ "eoa_token_id": 258883,
+ "eoa_token_index": 258883,
+ "eoi_token_id": 258882,
+ "eos_token_id": [
+ 1,
+ 106,
+ 50
+ ],
+ "image_token_id": 258880,
+ "initializer_range": 0.02,
+ "model_type": "gemma4",
+ "quantization": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine",
+ "language_model.model.layers.0.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.0.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.0.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.0.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.1.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.1.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.1.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.1.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.2.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.2.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.2.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.2.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.3.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.3.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.3.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.3.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.4.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.4.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.4.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.4.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.5.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.5.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.5.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.5.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.6.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.6.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.6.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.6.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.7.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.7.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.7.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.7.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.8.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.8.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.8.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.8.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.9.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.9.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.9.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.9.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.10.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.10.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.10.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.10.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.11.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.11.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.11.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.11.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.12.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.12.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.12.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.12.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.13.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.13.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.13.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.13.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.14.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.14.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.14.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.14.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.15.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.15.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.15.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.15.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.16.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.16.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.16.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.16.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.17.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.17.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.17.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.17.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.18.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.18.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.18.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.18.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.19.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.19.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.19.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.19.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.20.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.20.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.20.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.20.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.21.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.21.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.21.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.21.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.22.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.22.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.22.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.22.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.23.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.23.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.23.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.23.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.24.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.24.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.24.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.24.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.25.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.25.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.25.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.25.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.26.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.26.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.26.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.26.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.27.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.27.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.27.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.27.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.28.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.28.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.28.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.28.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.29.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.29.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.29.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.29.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ }
+ },
+ "quantization_config": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine",
+ "language_model.model.layers.0.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.0.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.0.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.0.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.1.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.1.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.1.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.1.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.2.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.2.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.2.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.2.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.3.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.3.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.3.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.3.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.4.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.4.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.4.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.4.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.5.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.5.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.5.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.5.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.6.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.6.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.6.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.6.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.7.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.7.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.7.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.7.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.8.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.8.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.8.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.8.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.9.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.9.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.9.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.9.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.10.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.10.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.10.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.10.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.11.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.11.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.11.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.11.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.12.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.12.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.12.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.12.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.13.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.13.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.13.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.13.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.14.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.14.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.14.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.14.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.15.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.15.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.15.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.15.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.16.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.16.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.16.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.16.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.17.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.17.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.17.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.17.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.18.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.18.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.18.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.18.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.19.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.19.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.19.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.19.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.20.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.20.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.20.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.20.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.21.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.21.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.21.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.21.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.22.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.22.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.22.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.22.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.23.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.23.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.23.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.23.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.24.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.24.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.24.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.24.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.25.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.25.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.25.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.25.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.26.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.26.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.26.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.26.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.27.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.27.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.27.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.27.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.28.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.28.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.28.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.28.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.29.mlp.gate_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.29.mlp.down_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.29.mlp.up_proj": {
+ "group_size": 64,
+ "bits": 8
+ },
+ "language_model.model.layers.29.router.proj": {
+ "group_size": 64,
+ "bits": 8
+ }
+ },
+ "text_config": {
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "attention_k_eq_v": true,
+ "bos_token_id": 2,
+ "dtype": "bfloat16",
+ "enable_moe_block": true,
+ "eos_token_id": 1,
+ "final_logit_softcapping": 30.0,
+ "global_head_dim": 512,
+ "head_dim": 256,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 2816,
+ "hidden_size_per_layer_input": 0,
+ "initializer_range": 0.02,
+ "intermediate_size": 2112,
+ "layer_types": [
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 262144,
+ "model_type": "gemma4_text",
+ "moe_intermediate_size": 704,
+ "num_attention_heads": 16,
+ "num_experts": 128,
+ "num_global_key_value_heads": 2,
+ "num_hidden_layers": 30,
+ "num_key_value_heads": 8,
+ "num_kv_shared_layers": 0,
+ "pad_token_id": 0,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "full_attention": {
+ "partial_rotary_factor": 0.25,
+ "rope_theta": 1000000.0,
+ "rope_type": "proportional"
+ },
+ "sliding_attention": {
+ "rope_theta": 10000.0,
+ "rope_type": "default"
+ }
+ },
+ "sliding_window": 1024,
+ "tie_word_embeddings": true,
+ "top_k_experts": 8,
+ "use_bidirectional_attention": "vision",
+ "use_cache": true,
+ "use_double_wide_mlp": false,
+ "vocab_size": 262144,
+ "vocab_size_per_layer_input": 262144
+ },
+ "tie_word_embeddings": true,
+ "transformers_version": "5.5.0.dev0",
+ "video_token_id": 258884,
+ "vision_config": {
+ "_name_or_path": "",
+ "architectures": null,
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "chunk_size_feed_forward": 0,
+ "default_output_length": 280,
+ "dtype": "bfloat16",
+ "global_head_dim": 72,
+ "head_dim": 72,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 1152,
+ "id2label": {
+ "0": "LABEL_0",
+ "1": "LABEL_1"
+ },
+ "initializer_range": 0.02,
+ "intermediate_size": 4304,
+ "is_encoder_decoder": false,
+ "label2id": {
+ "LABEL_0": 0,
+ "LABEL_1": 1
+ },
+ "max_position_embeddings": 131072,
+ "model_type": "gemma4_vision",
+ "num_attention_heads": 16,
+ "num_hidden_layers": 27,
+ "num_key_value_heads": 16,
+ "output_attentions": false,
+ "output_hidden_states": false,
+ "patch_size": 16,
+ "pooling_kernel_size": 3,
+ "position_embedding_size": 10240,
+ "problem_type": null,
+ "return_dict": true,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 100.0,
+ "rope_type": "default"
+ },
+ "standardize": true,
+ "use_clipped_linears": false
+ },
+ "vision_soft_tokens_per_image": 280
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/generation_config.json b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/generation_config.json
new file mode 100644
index 0000000..e605bb4
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/generation_config.json
@@ -0,0 +1,14 @@
+{
+ "bos_token_id": 2,
+ "do_sample": true,
+ "eos_token_id": [
+ 1,
+ 106,
+ 50
+ ],
+ "pad_token_id": 0,
+ "temperature": 1.0,
+ "top_k": 64,
+ "top_p": 0.95,
+ "transformers_version": "5.5.0.dev0"
+}
diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00001-of-00003.safetensors b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00001-of-00003.safetensors
new file mode 100644
index 0000000..8a3ab61
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00001-of-00003.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:6a6cba167e5c630a69b527b2b095c0da623507511e43c05a57c5527d9b66fa0d
+size 5275612587
diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00002-of-00003.safetensors b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00002-of-00003.safetensors
new file mode 100644
index 0000000..df970a5
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00002-of-00003.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:922461e4da8c9e3ae2dc5e4f0ccedf5a0259f1e81d3ebda20b3af39e28118f33
+size 5296718232
diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00003-of-00003.safetensors b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00003-of-00003.safetensors
new file mode 100644
index 0000000..1812e88
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00003-of-00003.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:2e92af87837744c385101b71883b4af898be7a6ce03e5babca475899a8268347
+size 5036507755
diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model.safetensors.index.json
new file mode 100644
index 0000000..ebc8565
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model.safetensors.index.json
@@ -0,0 +1,1704 @@
+{
+ "metadata": {
+ "total_size": 15608614044
+ },
+ "weight_map": {
+ "embed_vision.embedding_projection.biases": "model-00003-of-00003.safetensors",
+ "embed_vision.embedding_projection.scales": "model-00003-of-00003.safetensors",
+ "embed_vision.embedding_projection.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.embed_tokens.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.embed_tokens.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.embed_tokens.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.layer_scalar": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.router.per_expert_scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.router.proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.router.proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.router.proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.router.scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.self_attn.k_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.self_attn.q_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.0.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.layer_scalar": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.router.per_expert_scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.router.proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.router.proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.router.proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.router.scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.self_attn.k_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.self_attn.q_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.1.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.10.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.10.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.10.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.10.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.10.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.10.input_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.layer_scalar": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.10.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.10.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.10.router.per_expert_scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.router.proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.router.proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.router.proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.router.scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.self_attn.k_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.self_attn.q_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.10.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.11.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.input_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.layer_scalar": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.router.per_expert_scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.router.proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.router.proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.router.proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.router.scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.self_attn.k_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.self_attn.q_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.input_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.layer_scalar": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.router.per_expert_scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.router.proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.router.proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.router.proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.router.scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.self_attn.k_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.self_attn.q_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.12.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.input_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.layer_scalar": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.router.per_expert_scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.router.proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.router.proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.router.proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.router.scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.self_attn.k_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.self_attn.q_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.13.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.input_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.layer_scalar": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.router.per_expert_scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.router.proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.router.proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.router.proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.router.scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.self_attn.k_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.self_attn.q_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.14.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.input_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.layer_scalar": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.router.per_expert_scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.router.proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.router.proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.router.proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.router.scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.self_attn.k_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.self_attn.q_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.input_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.layer_scalar": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.router.per_expert_scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.router.proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.router.proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.router.proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.router.scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.self_attn.k_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.self_attn.q_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.16.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.input_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.layer_scalar": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.router.per_expert_scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.router.proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.router.proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.router.proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.router.scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.self_attn.k_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.self_attn.q_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.17.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.input_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.layer_scalar": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.router.per_expert_scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.router.proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.router.proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.router.proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.router.scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.self_attn.k_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.self_attn.q_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.18.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.input_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.layer_scalar": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.router.per_expert_scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.router.proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.router.proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.router.proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.router.scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.self_attn.k_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.self_attn.q_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.2.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.layer_scalar": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.router.per_expert_scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.router.proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.router.proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.router.proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.router.scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.self_attn.k_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.self_attn.q_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.2.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.20.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.input_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.layer_scalar": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.router.per_expert_scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.router.proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.router.proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.router.proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.router.scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.self_attn.k_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.self_attn.q_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.20.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.21.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.21.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.21.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.input_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.layer_scalar": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.post_attention_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.21.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.21.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.21.router.per_expert_scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.router.proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.router.proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.router.proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.router.scale": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.self_attn.k_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.self_attn.k_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.self_attn.k_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.self_attn.k_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.self_attn.o_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.self_attn.o_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.self_attn.o_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.self_attn.q_norm.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.self_attn.q_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.self_attn.q_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.self_attn.q_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.self_attn.v_proj.biases": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.self_attn.v_proj.scales": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.21.self_attn.v_proj.weight": "model-00002-of-00003.safetensors",
+ "language_model.model.layers.22.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.layer_scalar": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.router.per_expert_scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.router.proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.router.proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.router.proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.router.scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.self_attn.k_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.self_attn.k_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.self_attn.o_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.self_attn.o_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.self_attn.q_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.self_attn.q_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.self_attn.v_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.self_attn.v_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.22.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.layer_scalar": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.router.per_expert_scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.router.proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.router.proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.router.proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.router.scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.layer_scalar": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.router.per_expert_scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.router.proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.router.proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.router.proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.router.scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.self_attn.k_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.self_attn.k_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.self_attn.o_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.self_attn.o_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.self_attn.q_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.self_attn.q_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.self_attn.v_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.self_attn.v_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.24.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.layer_scalar": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.router.per_expert_scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.router.proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.router.proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.router.proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.router.scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.self_attn.k_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.self_attn.k_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.self_attn.o_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.self_attn.o_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.self_attn.q_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.self_attn.q_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.self_attn.v_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.self_attn.v_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.25.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.layer_scalar": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.router.per_expert_scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.router.proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.router.proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.router.proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.router.scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.self_attn.k_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.self_attn.k_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.self_attn.o_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.self_attn.o_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.self_attn.q_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.self_attn.q_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.self_attn.v_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.self_attn.v_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.26.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.layer_scalar": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.router.per_expert_scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.router.proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.router.proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.router.proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.router.scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.layer_scalar": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.router.per_expert_scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.router.proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.router.proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.router.proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.router.scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.self_attn.k_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.self_attn.k_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.self_attn.o_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.self_attn.o_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.self_attn.q_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.self_attn.q_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.self_attn.v_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.self_attn.v_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.28.self_attn.v_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.layer_scalar": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.router.per_expert_scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.router.proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.router.proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.router.proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.router.scale": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.self_attn.k_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.self_attn.k_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.self_attn.k_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.self_attn.o_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.self_attn.o_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.self_attn.o_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.self_attn.q_proj.biases": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.self_attn.q_proj.scales": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.29.self_attn.q_proj.weight": "model-00003-of-00003.safetensors",
+ "language_model.model.layers.3.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.layer_scalar": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.router.per_expert_scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.router.proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.router.proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.router.proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.router.scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.self_attn.k_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.self_attn.q_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.layer_scalar": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.router.per_expert_scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.router.proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.router.proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.router.proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.router.scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.self_attn.k_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.self_attn.q_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.4.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.layer_scalar": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.router.per_expert_scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.router.proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.router.proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.router.proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.router.scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.self_attn.k_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.self_attn.q_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.5.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.input_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.layer_scalar": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.router.per_expert_scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.router.proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.router.proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.router.proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.router.scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.self_attn.k_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.self_attn.q_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.6.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.layer_scalar": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.router.per_expert_scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.router.proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.router.proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.router.proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.router.scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.self_attn.q_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.layer_scalar": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.router.per_expert_scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.router.proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.router.proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.router.proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.router.scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.self_attn.k_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.self_attn.q_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.8.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.input_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.layer_scalar": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.router.per_expert_scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.router.proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.router.proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.router.proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.router.scale": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.self_attn.k_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.self_attn.k_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.self_attn.k_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.self_attn.k_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.self_attn.o_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.self_attn.o_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.self_attn.o_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.self_attn.q_norm.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.self_attn.q_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.self_attn.q_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.self_attn.q_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.self_attn.v_proj.biases": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.self_attn.v_proj.scales": "model-00001-of-00003.safetensors",
+ "language_model.model.layers.9.self_attn.v_proj.weight": "model-00001-of-00003.safetensors",
+ "language_model.model.norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.0.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.0.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.0.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.0.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.0.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.0.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.0.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.1.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.1.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.1.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.1.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.1.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.1.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.1.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.10.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.10.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.10.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.10.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.10.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.10.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.10.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.11.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.11.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.11.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.11.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.11.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.11.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.11.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.12.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.12.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.12.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.12.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.12.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.12.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.12.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.13.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.13.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.13.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.13.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.13.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.13.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.13.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.14.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.14.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.14.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.14.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.14.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.14.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.14.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.15.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.15.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.15.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.15.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.15.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.15.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.15.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.16.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.16.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.16.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.16.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.16.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.16.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.16.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.16.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.16.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.16.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.16.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.16.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.16.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.17.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.17.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.17.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.17.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.17.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.17.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.17.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.17.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.17.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.17.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.17.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.17.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.17.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.18.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.18.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.18.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.18.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.18.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.18.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.18.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.18.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.18.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.18.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.18.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.18.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.18.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.19.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.19.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.19.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.19.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.19.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.19.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.19.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.19.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.19.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.19.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.19.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.19.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.19.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.2.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.2.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.2.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.2.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.2.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.2.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.2.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.20.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.20.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.20.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.20.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.20.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.20.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.20.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.20.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.20.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.20.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.20.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.20.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.20.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.21.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.21.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.21.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.21.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.21.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.21.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.21.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.21.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.21.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.21.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.21.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.21.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.21.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.22.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.22.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.22.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.22.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.22.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.22.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.22.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.22.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.22.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.22.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.22.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.22.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.22.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.23.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.23.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.23.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.23.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.23.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.23.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.23.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.23.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.23.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.23.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.23.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.23.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.23.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.24.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.24.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.24.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.24.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.24.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.24.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.24.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.24.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.24.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.24.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.24.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.24.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.24.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.25.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.25.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.25.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.25.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.25.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.25.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.25.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.25.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.25.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.25.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.25.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.25.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.25.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.26.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.26.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.26.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.26.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.26.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.26.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.26.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.26.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.26.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.26.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.26.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.26.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.26.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.3.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.3.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.3.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.3.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.3.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.3.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.3.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.4.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.4.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.4.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.4.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.4.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.4.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.4.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.5.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.5.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.5.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.5.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.5.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.5.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.5.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.6.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.6.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.6.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.6.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.6.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.6.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.6.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.7.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.7.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.7.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.7.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.7.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.7.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.7.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.8.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.8.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.8.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.8.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.8.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.8.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.8.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.9.input_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.9.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.9.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.9.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.9.post_attention_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.9.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.9.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.k_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.q_norm.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.patch_embedder.input_proj.weight": "model-00003-of-00003.safetensors",
+ "vision_tower.patch_embedder.position_embedding_table": "model-00003-of-00003.safetensors",
+ "vision_tower.std_bias": "model-00003-of-00003.safetensors",
+ "vision_tower.std_scale": "model-00003-of-00003.safetensors"
+ }
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/processor_config.json b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/processor_config.json
new file mode 100644
index 0000000..09dfe23
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/processor_config.json
@@ -0,0 +1,32 @@
+{
+ "audio_seq_length": 750,
+ "image_processor": {
+ "do_convert_rgb": true,
+ "do_normalize": false,
+ "do_rescale": true,
+ "do_resize": true,
+ "image_mean": [
+ 0.0,
+ 0.0,
+ 0.0
+ ],
+ "image_processor_type": "Gemma4ImageProcessor",
+ "image_seq_length": 280,
+ "image_std": [
+ 1.0,
+ 1.0,
+ 1.0
+ ],
+ "max_soft_tokens": 280,
+ "patch_size": 16,
+ "pooling_kernel_size": 3,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "size": {
+ "height": 224,
+ "width": 224
+ }
+ },
+ "image_seq_length": 280,
+ "processor_class": "Gemma4Processor"
+}
diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/tokenizer.json b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/tokenizer.json
new file mode 100644
index 0000000..1ff9f3e
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:cc8d3a0ce36466ccc1278bf987df5f71db1719b9ca6b4118264f45cb627bfe0f
+size 32169626
diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/tokenizer_config.json b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/tokenizer_config.json
new file mode 100644
index 0000000..375b25d
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/tokenizer_config.json
@@ -0,0 +1,74 @@
+{
+ "audio_token": "<|audio|>",
+ "backend": "tokenizers",
+ "boa_token": "<|audio>",
+ "boi_token": "<|image>",
+ "bos_token": "",
+ "eoa_token": "",
+ "eoc_token": "",
+ "eoi_token": "",
+ "eos_token": "",
+ "eot_token": "",
+ "escape_token": "<|\"|>",
+ "etc_token": "",
+ "etd_token": "",
+ "etr_token": "",
+ "extra_special_tokens": [
+ "<|video|>"
+ ],
+ "image_token": "<|image|>",
+ "mask_token": "",
+ "model_max_length": 1000000000000000019884624838656,
+ "pad_token": "",
+ "padding_side": "left",
+ "processor_class": "Gemma4Processor",
+ "response_schema": {
+ "type": "object",
+ "properties": {
+ "role": {
+ "const": "assistant"
+ },
+ "thinking": {
+ "type": "string"
+ },
+ "content": {
+ "type": "string"
+ },
+ "tool_calls": {
+ "x-regex-iterator": "<\\|tool_call>(.*?)",
+ "type": "array",
+ "items": {
+ "type": "object",
+ "properties": {
+ "type": {
+ "const": "function"
+ },
+ "function": {
+ "type": "object",
+ "x-regex": "call\\:(?P\\w+)(?P\\{.*\\})",
+ "properties": {
+ "name": {
+ "type": "string"
+ },
+ "arguments": {
+ "type": "object",
+ "x-parser": "gemma4-tool-call",
+ "additionalProperties": {}
+ }
+ }
+ }
+ }
+ }
+ }
+ },
+ "x-regex": "(\\<\\|channel\\>thought\\n(?P.*?)\\)?(?P\\<\\|tool_call\\>.*\\)?(?P(?:(?!\\)(?!\\<\\|tool_response\\>).)+)?(?:\\|\\<\\|tool_response\\>)?"
+ },
+ "soc_token": "<|channel>",
+ "sot_token": "<|turn>",
+ "stc_token": "<|tool_call>",
+ "std_token": "<|tool>",
+ "str_token": "<|tool_response>",
+ "think_token": "<|think|>",
+ "tokenizer_class": "GemmaTokenizer",
+ "unk_token": ""
+}
diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/.gitattributes b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/.gitattributes
new file mode 100644
index 0000000..52373fe
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/.gitattributes
@@ -0,0 +1,36 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/README.md b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/README.md
new file mode 100644
index 0000000..b30b13e
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/README.md
@@ -0,0 +1,25 @@
+---
+library_name: mlx
+license: apache-2.0
+license_link: https://ai.google.dev/gemma/docs/gemma_4_license
+pipeline_tag: any-to-any
+tags:
+- mlx
+base_model: google/gemma-4-e2b-it
+---
+
+# mlx-community/gemma-4-e2b-it-4bit
+
+This model was converted to MLX format from [`google/gemma-4-e2b-it`](https://huggingface.co/google/gemma-4-e2b-it)
+using mlx-vlm version **0.4.3**.
+Refer to the [original model card](https://huggingface.co/google/gemma-4-e2b-it) for more details on the model.
+
+## Use with mlx
+
+```bash
+pip install -U mlx-vlm
+```
+
+```bash
+python -m mlx_vlm.generate --model mlx-community/gemma-4-e2b-it-4bit --max-tokens 100 --temperature 0.0 --prompt "Describe this image." --image
+```
diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/chat_template.jinja b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/chat_template.jinja
new file mode 100644
index 0000000..c19999a
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/chat_template.jinja
@@ -0,0 +1,360 @@
+{%- macro format_parameters(properties, required, filter_keys=false) -%}
+ {%- set standard_keys = ['description', 'type', 'properties', 'required', 'nullable'] -%}
+ {%- set ns = namespace(found_first=false) -%}
+ {%- for key, value in properties | dictsort -%}
+ {%- set add_comma = false -%}
+ {%- if not filter_keys or key not in standard_keys -%}
+ {%- if ns.found_first %},{% endif -%}
+ {%- set ns.found_first = true -%}
+ {{ key }}:{
+ {%- if value['description'] -%}
+ description:<|"|>{{ value['description'] }}<|"|>
+ {%- set add_comma = true -%}
+ {%- endif -%}
+ {%- if value['type'] | upper == 'STRING' -%}
+ {%- if value['enum'] -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ enum:{{ format_argument(value['enum']) }}
+ {%- endif -%}
+ {%- elif value['type'] | upper == 'ARRAY' -%}
+ {%- if value['items'] is mapping and value['items'] -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ items:{
+ {%- set ns_items = namespace(found_first=false) -%}
+ {%- for item_key, item_value in value['items'] | dictsort -%}
+ {%- if item_value is not none -%}
+ {%- if ns_items.found_first %},{% endif -%}
+ {%- set ns_items.found_first = true -%}
+ {%- if item_key == 'properties' -%}
+ properties:{
+ {%- if item_value is mapping -%}
+ {{- format_parameters(item_value, value['items']['required'] | default([])) -}}
+ {%- endif -%}
+ }
+ {%- elif item_key == 'required' -%}
+ required:[
+ {%- for req_item in item_value -%}
+ <|"|>{{- req_item -}}<|"|>
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ ]
+ {%- elif item_key == 'type' -%}
+ {%- if item_value is string -%}
+ type:{{ format_argument(item_value | upper) }}
+ {%- else -%}
+ type:{{ format_argument(item_value | map('upper') | list) }}
+ {%- endif -%}
+ {%- else -%}
+ {{ item_key }}:{{ format_argument(item_value) }}
+ {%- endif -%}
+ {%- endif -%}
+ {%- endfor -%}
+ }
+ {%- endif -%}
+ {%- endif -%}
+ {%- if value['nullable'] %}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ nullable:true
+ {%- endif -%}
+ {%- if value['type'] | upper == 'OBJECT' -%}
+ {%- if value['properties'] is defined and value['properties'] is mapping -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ properties:{
+ {{- format_parameters(value['properties'], value['required'] | default([])) -}}
+ }
+ {%- elif value is mapping -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ properties:{
+ {{- format_parameters(value, value['required'] | default([]), filter_keys=true) -}}
+ }
+ {%- endif -%}
+ {%- if value['required'] -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ required:[
+ {%- for item in value['required'] | default([]) -%}
+ <|"|>{{- item -}}<|"|>
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ ]
+ {%- endif -%}
+ {%- endif -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ type:<|"|>{{ value['type'] | upper }}<|"|>}
+ {%- endif -%}
+ {%- endfor -%}
+{%- endmacro -%}
+{%- macro format_function_declaration(tool_data) -%}
+ declaration:{{- tool_data['function']['name'] -}}{description:<|"|>{{- tool_data['function']['description'] -}}<|"|>
+ {%- set params = tool_data['function']['parameters'] -%}
+ {%- if params -%}
+ ,parameters:{
+ {%- if params['properties'] -%}
+ properties:{ {{- format_parameters(params['properties'], params['required']) -}} },
+ {%- endif -%}
+ {%- if params['required'] -%}
+ required:[
+ {%- for item in params['required'] -%}
+ <|"|>{{- item -}}<|"|>
+ {{- ',' if not loop.last -}}
+ {%- endfor -%}
+ ],
+ {%- endif -%}
+ {%- if params['type'] -%}
+ type:<|"|>{{- params['type'] | upper -}}<|"|>}
+ {%- endif -%}
+ {%- endif -%}
+ {%- if 'response' in tool_data['function'] -%}
+ {%- set response_declaration = tool_data['function']['response'] -%}
+ ,response:{
+ {%- if response_declaration['description'] -%}
+ description:<|"|>{{- response_declaration['description'] -}}<|"|>,
+ {%- endif -%}
+ {%- if response_declaration['type'] | upper == 'OBJECT' -%}
+ type:<|"|>{{- response_declaration['type'] | upper -}}<|"|>}
+ {%- endif -%}
+ {%- endif -%}
+ }
+{%- endmacro -%}
+{%- macro format_argument(argument, escape_keys=True) -%}
+ {%- if argument is string -%}
+ {{- '<|"|>' + argument + '<|"|>' -}}
+ {%- elif argument is boolean -%}
+ {{- 'true' if argument else 'false' -}}
+ {%- elif argument is mapping -%}
+ {{- '{' -}}
+ {%- set ns = namespace(found_first=false) -%}
+ {%- for key, value in argument | dictsort -%}
+ {%- if ns.found_first %},{% endif -%}
+ {%- set ns.found_first = true -%}
+ {%- if escape_keys -%}
+ {{- '<|"|>' + key + '<|"|>' -}}
+ {%- else -%}
+ {{- key -}}
+ {%- endif -%}
+ :{{- format_argument(value, escape_keys=escape_keys) -}}
+ {%- endfor -%}
+ {{- '}' -}}
+ {%- elif argument is sequence -%}
+ {{- '[' -}}
+ {%- for item in argument -%}
+ {{- format_argument(item, escape_keys=escape_keys) -}}
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ {{- ']' -}}
+ {%- else -%}
+ {{- argument -}}
+ {%- endif -%}
+{%- endmacro -%}
+{%- macro strip_thinking(text) -%}
+ {%- set ns = namespace(result='') -%}
+ {%- for part in text.split('') -%}
+ {%- if '<|channel>' in part -%}
+ {%- set ns.result = ns.result + part.split('<|channel>')[0] -%}
+ {%- else -%}
+ {%- set ns.result = ns.result + part -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {{- ns.result | trim -}}
+{%- endmacro -%}
+
+{%- macro format_tool_response_block(tool_name, response) -%}
+ {{- '<|tool_response>' -}}
+ {%- if response is mapping -%}
+ {{- 'response:' + tool_name + '{' -}}
+ {%- for key, value in response | dictsort -%}
+ {{- key -}}:{{- format_argument(value, escape_keys=False) -}}
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ {{- '}' -}}
+ {%- else -%}
+ {{- 'response:' + tool_name + '{value:' + format_argument(response, escape_keys=False) + '}' -}}
+ {%- endif -%}
+ {{- '' -}}
+{%- endmacro -%}
+
+{%- set ns = namespace(prev_message_type=None) -%}
+{%- set loop_messages = messages -%}
+{{- bos_token -}}
+{#- Handle System/Tool Definitions Block -#}
+{%- if (enable_thinking is defined and enable_thinking) or tools or messages[0]['role'] in ['system', 'developer'] -%}
+ {{- '<|turn>system\n' -}}
+ {#- Inject Thinking token at the very top of the FIRST system turn -#}
+ {%- if enable_thinking is defined and enable_thinking -%}
+ {{- '<|think|>\n' -}}
+ {%- set ns.prev_message_type = 'think' -%}
+ {%- endif -%}
+ {%- if messages[0]['role'] in ['system', 'developer'] -%}
+ {%- if messages[0]['content'] is string -%}
+ {{- messages[0]['content'] | trim -}}
+ {%- elif messages[0]['content'] is sequence -%}
+ {%- for item in messages[0]['content'] -%}
+ {{- item['text'] | trim + ' '-}}
+ {%- endfor -%}
+ {%- endif -%}
+ {%- set loop_messages = messages[1:] -%}
+ {%- endif -%}
+ {%- if tools -%}
+ {%- for tool in tools %}
+ {{- '<|tool>' -}}
+ {{- format_function_declaration(tool) | trim -}}
+ {{- '' -}}
+ {%- endfor %}
+ {%- set ns.prev_message_type = 'tool' -%}
+ {%- endif -%}
+ {{- '\n' -}}
+{%- endif %}
+
+{#- Pre-scan: find last user message index for reasoning guard -#}
+{%- set ns_turn = namespace(last_user_idx=-1) -%}
+{%- for i in range(loop_messages | length) -%}
+ {%- if loop_messages[i]['role'] == 'user' -%}
+ {%- set ns_turn.last_user_idx = i -%}
+ {%- endif -%}
+{%- endfor -%}
+
+{#- Loop through messages -#}
+{%- for message in loop_messages -%}
+ {%- if message['role'] != 'tool' -%}
+ {%- set ns.prev_message_type = None -%}
+ {%- set role = 'model' if message['role'] == 'assistant' else message['role'] -%}
+ {#- Detect continuation: suppress duplicate <|turn>model when previous non-tool message was also assistant -#}
+ {%- set prev_nt = namespace(role=None, found=false) -%}
+ {%- if loop.index0 > 0 -%}
+ {%- for j in range(loop.index0 - 1, -1, -1) -%}
+ {%- if not prev_nt.found -%}
+ {%- if loop_messages[j]['role'] != 'tool' -%}
+ {%- set prev_nt.role = loop_messages[j]['role'] -%}
+ {%- set prev_nt.found = true -%}
+ {%- endif -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- endif -%}
+ {%- set continue_same_model_turn = (role == 'model' and prev_nt.role == 'assistant') -%}
+ {%- if not continue_same_model_turn -%}
+ {{- '<|turn>' + role + '\n' }}
+ {%- endif -%}
+
+ {#- Render reasoning/reasoning_content as thinking channel -#}
+ {%- set thinking_text = message.get('reasoning') or message.get('reasoning_content') -%}
+ {%- if thinking_text and loop.index0 > ns_turn.last_user_idx and message.get('tool_calls') -%}
+ {{- '<|channel>thought\n' + thinking_text + '\n' -}}
+ {%- endif -%}
+
+ {%- if message['tool_calls'] -%}
+ {%- for tool_call in message['tool_calls'] -%}
+ {%- set function = tool_call['function'] -%}
+ {{- '<|tool_call>call:' + function['name'] + '{' -}}
+ {%- if function['arguments'] is mapping -%}
+ {%- set ns_args = namespace(found_first=false) -%}
+ {%- for key, value in function['arguments'] | dictsort -%}
+ {%- if ns_args.found_first %},{% endif -%}
+ {%- set ns_args.found_first = true -%}
+ {{- key -}}:{{- format_argument(value, escape_keys=False) -}}
+ {%- endfor -%}
+ {%- elif function['arguments'] is string -%}
+ {{- function['arguments'] -}}
+ {%- endif -%}
+ {{- '}' -}}
+ {%- endfor -%}
+ {%- set ns.prev_message_type = 'tool_call' -%}
+ {%- endif -%}
+
+ {%- set ns_tr_out = namespace(flag=false) -%}
+ {%- if message.get('tool_responses') -%}
+ {#- Legacy: tool_responses embedded on the assistant message (Google/Gemma native) -#}
+ {%- for tool_response in message['tool_responses'] -%}
+ {{- format_tool_response_block(tool_response['name'] | default('unknown'), tool_response['response']) -}}
+ {%- set ns_tr_out.flag = true -%}
+ {%- set ns.prev_message_type = 'tool_response' -%}
+ {%- endfor -%}
+ {%- elif message.get('tool_calls') -%}
+ {#- OpenAI Chat Completions: forward-scan consecutive role:tool messages -#}
+ {%- set ns_tool_scan = namespace(stopped=false) -%}
+ {%- for k in range(loop.index0 + 1, loop_messages | length) -%}
+ {%- if ns_tool_scan.stopped -%}
+ {%- elif loop_messages[k]['role'] != 'tool' -%}
+ {%- set ns_tool_scan.stopped = true -%}
+ {%- else -%}
+ {%- set follow = loop_messages[k] -%}
+ {#- Resolve tool_call_id to function name -#}
+ {%- set ns_tname = namespace(name=follow.get('name') | default('unknown')) -%}
+ {%- for tc in message['tool_calls'] -%}
+ {%- if tc.get('id') == follow.get('tool_call_id') -%}
+ {%- set ns_tname.name = tc['function']['name'] -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {#- Handle content as string or content-parts array -#}
+ {%- set tool_body = follow.get('content') -%}
+ {%- if tool_body is string -%}
+ {{- format_tool_response_block(ns_tname.name, tool_body) -}}
+ {%- elif tool_body is sequence and tool_body is not string -%}
+ {%- set ns_txt = namespace(s='') -%}
+ {%- for part in tool_body -%}
+ {%- if part.get('type') == 'text' -%}
+ {%- set ns_txt.s = ns_txt.s + (part.get('text') | default('')) -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {{- format_tool_response_block(ns_tname.name, ns_txt.s) -}}
+ {%- for part in tool_body -%}
+ {%- if part.get('type') == 'image' -%}
+ {{- '<|image|>' -}}
+ {%- elif part.get('type') == 'audio' -%}
+ {{- '<|audio|>' -}}
+ {%- elif part.get('type') == 'video' -%}
+ {{- '<|video|>' -}}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- else -%}
+ {{- format_tool_response_block(ns_tname.name, tool_body) -}}
+ {%- endif -%}
+ {%- set ns_tr_out.flag = true -%}
+ {%- set ns.prev_message_type = 'tool_response' -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- endif -%}
+
+ {%- set captured_content -%}
+ {%- if message['content'] is string -%}
+ {%- if role == 'model' -%}
+ {{- strip_thinking(message['content']) -}}
+ {%- else -%}
+ {{- message['content'] | trim -}}
+ {%- endif -%}
+ {%- elif message['content'] is sequence -%}
+ {%- for item in message['content'] -%}
+ {%- if item['type'] == 'text' -%}
+ {%- if role == 'model' -%}
+ {{- strip_thinking(item['text']) -}}
+ {%- else -%}
+ {{- item['text'] | trim -}}
+ {%- endif -%}
+ {%- elif item['type'] == 'image' -%}
+ {{- '<|image|>' -}}
+ {%- set ns.prev_message_type = 'image' -%}
+ {%- elif item['type'] == 'audio' -%}
+ {{- '<|audio|>' -}}
+ {%- set ns.prev_message_type = 'audio' -%}
+ {%- elif item['type'] == 'video' -%}
+ {{- '<|video|>' -}}
+ {%- set ns.prev_message_type = 'video' -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- endif -%}
+ {%- endset -%}
+
+ {{- captured_content -}}
+ {%- set has_content = captured_content | trim | length > 0 -%}
+
+ {%- if ns.prev_message_type == 'tool_call' and not ns_tr_out.flag -%}
+ {{- '<|tool_response>' -}}
+ {%- elif not (ns_tr_out.flag and not has_content) -%}
+ {{- '\n' -}}
+ {%- endif -%}
+ {%- endif -%}
+{%- endfor -%}
+
+{%- if add_generation_prompt -%}
+ {%- if ns.prev_message_type != 'tool_response' and ns.prev_message_type != 'tool_call' -%}
+ {{- '<|turn>model\n' -}}
+ {%- endif -%}
+{%- endif -%}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/config.json b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/config.json
new file mode 100644
index 0000000..e4f9de9
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/config.json
@@ -0,0 +1,201 @@
+{
+ "architectures": [
+ "Gemma4ForConditionalGeneration"
+ ],
+ "audio_config": {
+ "_name_or_path": "",
+ "architectures": null,
+ "attention_chunk_size": 12,
+ "attention_context_left": 13,
+ "attention_context_right": 0,
+ "attention_invalid_logits_value": -1000000000.0,
+ "attention_logit_cap": 50.0,
+ "chunk_size_feed_forward": 0,
+ "conv_kernel_size": 5,
+ "dtype": "bfloat16",
+ "gradient_clipping": 10000000000.0,
+ "hidden_act": "silu",
+ "hidden_size": 1024,
+ "id2label": {
+ "0": "LABEL_0",
+ "1": "LABEL_1"
+ },
+ "initializer_range": 0.02,
+ "is_encoder_decoder": false,
+ "label2id": {
+ "LABEL_0": 0,
+ "LABEL_1": 1
+ },
+ "model_type": "gemma4_audio",
+ "num_attention_heads": 8,
+ "num_hidden_layers": 12,
+ "output_attentions": false,
+ "output_hidden_states": false,
+ "output_proj_dims": 1536,
+ "problem_type": null,
+ "residual_weight": 0.5,
+ "return_dict": true,
+ "rms_norm_eps": 1e-06,
+ "subsampling_conv_channels": [
+ 128,
+ 32
+ ],
+ "use_clipped_linears": true
+ },
+ "audio_token_id": 258881,
+ "boa_token_id": 256000,
+ "boi_token_id": 255999,
+ "dtype": "bfloat16",
+ "eoa_token_id": 258883,
+ "eoa_token_index": 258883,
+ "eoi_token_id": 258882,
+ "eos_token_id": [
+ 1,
+ 106,
+ 50
+ ],
+ "image_token_id": 258880,
+ "initializer_range": 0.02,
+ "model_type": "gemma4",
+ "quantization": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine"
+ },
+ "quantization_config": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine"
+ },
+ "text_config": {
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "attention_k_eq_v": false,
+ "bos_token_id": 2,
+ "dtype": "bfloat16",
+ "enable_moe_block": false,
+ "eos_token_id": 1,
+ "expert_intermediate_size": null,
+ "final_logit_softcapping": 30.0,
+ "global_head_dim": 512,
+ "head_dim": 256,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 1536,
+ "hidden_size_per_layer_input": 256,
+ "initializer_range": 0.02,
+ "intermediate_size": 6144,
+ "layer_types": [
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 131072,
+ "model_type": "gemma4_text",
+ "num_attention_heads": 8,
+ "num_experts": null,
+ "num_global_key_value_heads": null,
+ "num_hidden_layers": 35,
+ "num_key_value_heads": 1,
+ "num_kv_shared_layers": 20,
+ "pad_token_id": 0,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "full_attention": {
+ "partial_rotary_factor": 0.25,
+ "rope_theta": 1000000.0,
+ "rope_type": "proportional"
+ },
+ "sliding_attention": {
+ "rope_theta": 10000.0,
+ "rope_type": "default"
+ }
+ },
+ "sliding_window": 512,
+ "tie_word_embeddings": true,
+ "top_k_experts": null,
+ "use_bidirectional_attention": null,
+ "use_cache": true,
+ "use_double_wide_mlp": true,
+ "vocab_size": 262144,
+ "vocab_size_per_layer_input": 262144
+ },
+ "tie_word_embeddings": true,
+ "transformers_version": "5.5.0.dev0",
+ "video_token_id": 258884,
+ "vision_config": {
+ "_name_or_path": "",
+ "architectures": null,
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "chunk_size_feed_forward": 0,
+ "default_output_length": 280,
+ "dtype": "bfloat16",
+ "global_head_dim": 64,
+ "head_dim": 64,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 768,
+ "id2label": {
+ "0": "LABEL_0",
+ "1": "LABEL_1"
+ },
+ "initializer_range": 0.02,
+ "intermediate_size": 3072,
+ "is_encoder_decoder": false,
+ "label2id": {
+ "LABEL_0": 0,
+ "LABEL_1": 1
+ },
+ "max_position_embeddings": 131072,
+ "model_type": "gemma4_vision",
+ "num_attention_heads": 12,
+ "num_hidden_layers": 16,
+ "num_key_value_heads": 12,
+ "output_attentions": false,
+ "output_hidden_states": false,
+ "patch_size": 16,
+ "pooling_kernel_size": 3,
+ "position_embedding_size": 10240,
+ "problem_type": null,
+ "return_dict": true,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 100.0,
+ "rope_type": "default"
+ },
+ "standardize": false,
+ "use_clipped_linears": true
+ },
+ "vision_soft_tokens_per_image": 280
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/generation_config.json b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/generation_config.json
new file mode 100644
index 0000000..e605bb4
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/generation_config.json
@@ -0,0 +1,14 @@
+{
+ "bos_token_id": 2,
+ "do_sample": true,
+ "eos_token_id": [
+ 1,
+ 106,
+ 50
+ ],
+ "pad_token_id": 0,
+ "temperature": 1.0,
+ "top_k": 64,
+ "top_p": 0.95,
+ "transformers_version": "5.5.0.dev0"
+}
diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/model.safetensors b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/model.safetensors
new file mode 100644
index 0000000..3f82c0a
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e9bea0584546fafb5ff83a1132a6c4662a8498cc6a5bcda52fc6ca562b7bafab
+size 3581101896
diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/model.safetensors.index.json
new file mode 100644
index 0000000..cbba8cc
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/model.safetensors.index.json
@@ -0,0 +1,2656 @@
+{
+ "metadata": {
+ "total_size": 3580765126
+ },
+ "weight_map": {
+ "audio_tower.layers.0.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.0.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.0.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.0.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.0.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.0.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.0.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.0.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.0.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.0.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.0.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.0.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.0.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.0.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.1.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.1.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.1.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.1.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.1.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.1.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.1.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.1.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.1.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.1.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.1.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.1.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.1.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.10.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.10.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.10.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.10.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.10.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.10.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.10.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.10.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.10.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.10.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.10.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.10.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.10.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.11.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.11.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.11.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.11.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.11.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.11.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.11.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.11.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.11.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.11.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.11.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.11.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.11.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.2.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.2.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.2.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.2.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.2.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.2.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.2.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.2.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.2.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.2.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.2.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.2.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.2.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.3.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.3.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.3.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.3.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.3.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.3.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.3.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.3.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.3.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.3.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.3.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.3.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.3.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.4.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.4.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.4.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.4.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.4.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.4.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.4.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.4.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.4.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.4.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.4.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.4.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.4.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.5.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.5.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.5.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.5.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.5.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.5.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.5.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.5.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.5.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.5.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.5.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.5.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.5.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.6.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.6.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.6.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.6.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.6.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.6.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.6.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.6.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.6.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.6.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.6.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.6.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.6.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.7.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.7.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.7.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.7.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.7.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.7.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.7.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.7.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.7.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.7.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.7.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.7.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.7.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.8.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.8.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.8.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.8.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.8.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.8.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.8.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.8.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.8.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.8.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.8.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.8.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.8.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.9.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.9.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.9.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.9.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.9.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.9.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.9.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.9.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.9.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.9.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.9.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.9.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.9.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.output_proj.bias": "model.safetensors",
+ "audio_tower.output_proj.weight": "model.safetensors",
+ "audio_tower.subsample_conv_projection.input_proj_linear.weight": "model.safetensors",
+ "audio_tower.subsample_conv_projection.layer0.conv.weight": "model.safetensors",
+ "audio_tower.subsample_conv_projection.layer0.norm.weight": "model.safetensors",
+ "audio_tower.subsample_conv_projection.layer1.conv.weight": "model.safetensors",
+ "audio_tower.subsample_conv_projection.layer1.norm.weight": "model.safetensors",
+ "embed_audio.embedding_projection.biases": "model.safetensors",
+ "embed_audio.embedding_projection.scales": "model.safetensors",
+ "embed_audio.embedding_projection.weight": "model.safetensors",
+ "embed_vision.embedding_projection.biases": "model.safetensors",
+ "embed_vision.embedding_projection.scales": "model.safetensors",
+ "embed_vision.embedding_projection.weight": "model.safetensors",
+ "language_model.model.embed_tokens.biases": "model.safetensors",
+ "language_model.model.embed_tokens.scales": "model.safetensors",
+ "language_model.model.embed_tokens.weight": "model.safetensors",
+ "language_model.model.embed_tokens_per_layer.biases": "model.safetensors",
+ "language_model.model.embed_tokens_per_layer.scales": "model.safetensors",
+ "language_model.model.embed_tokens_per_layer.weight": "model.safetensors",
+ "language_model.model.layers.0.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.0.layer_scalar": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.0.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.0.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.0.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.0.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.0.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.0.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.0.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.0.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.0.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.0.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.0.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.0.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.1.layer_scalar": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.1.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.1.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.1.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.1.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.1.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.1.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.1.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.1.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.1.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.1.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.1.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.1.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.10.layer_scalar": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.10.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.10.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.10.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.10.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.10.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.10.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.10.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.10.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.10.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.10.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.10.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.10.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.layer_scalar": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.11.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.11.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.11.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.11.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.11.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.11.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.11.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.12.layer_scalar": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.12.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.12.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.12.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.12.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.12.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.12.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.12.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.12.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.12.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.12.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.12.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.12.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.13.layer_scalar": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.13.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.13.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.13.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.13.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.13.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.13.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.13.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.13.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.13.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.13.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.13.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.13.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.14.layer_scalar": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.14.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.14.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.14.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.14.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.14.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.14.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.14.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.14.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.14.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.14.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.14.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.14.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.layer_scalar": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.15.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.15.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.15.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.15.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.15.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.15.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.15.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.16.layer_scalar": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.16.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.16.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.16.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.16.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.16.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.16.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.16.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.16.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.16.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.16.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.16.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.16.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.17.layer_scalar": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.17.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.17.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.17.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.17.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.17.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.17.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.17.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.17.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.17.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.17.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.17.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.17.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.18.layer_scalar": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.18.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.18.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.18.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.18.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.18.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.18.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.18.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.18.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.18.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.18.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.18.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.18.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.layer_scalar": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.19.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.19.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.19.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.19.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.19.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.19.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.19.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.2.layer_scalar": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.2.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.2.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.2.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.2.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.2.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.2.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.2.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.2.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.2.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.2.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.2.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.2.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.20.layer_scalar": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.20.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.20.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.20.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.20.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.20.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.20.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.20.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.20.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.20.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.20.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.20.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.20.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.21.layer_scalar": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.21.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.21.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.21.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.21.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.21.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.21.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.21.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.21.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.21.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.21.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.21.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.21.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.22.layer_scalar": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.22.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.22.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.22.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.22.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.22.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.22.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.22.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.22.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.22.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.22.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.22.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.22.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.layer_scalar": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.23.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.23.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.23.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.23.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.23.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.23.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.23.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.24.layer_scalar": "model.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.24.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.24.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.24.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.24.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.24.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.24.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.24.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.24.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.24.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.24.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.24.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.24.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.25.layer_scalar": "model.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.25.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.25.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.25.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.25.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.25.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.25.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.25.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.25.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.25.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.25.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.25.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.25.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.26.layer_scalar": "model.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.26.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.26.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.26.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.26.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.26.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.26.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.26.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.26.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.26.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.26.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.26.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.26.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.27.layer_scalar": "model.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.27.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.27.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.27.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.27.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.27.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.27.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.27.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.27.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.27.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.28.layer_scalar": "model.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.28.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.28.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.28.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.28.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.28.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.28.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.28.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.28.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.28.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.28.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.28.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.28.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.29.layer_scalar": "model.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.29.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.29.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.29.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.29.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.29.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.29.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.29.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.29.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.29.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.29.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.29.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.29.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.layer_scalar": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.3.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.3.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.3.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.3.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.3.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.3.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.3.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.30.layer_scalar": "model.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.30.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.30.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.30.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.30.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.30.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.30.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.30.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.30.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.30.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.30.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.30.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.30.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.31.layer_scalar": "model.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.31.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.31.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.31.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.31.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.31.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.31.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.31.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.31.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.31.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.32.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.32.layer_scalar": "model.safetensors",
+ "language_model.model.layers.32.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.32.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.32.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.32.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.32.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.32.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.32.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.32.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.32.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.32.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.32.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.32.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.32.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.32.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.32.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.32.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.32.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.32.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.32.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.32.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.32.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.32.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.32.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.32.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.32.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.32.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.32.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.32.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.32.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.32.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.32.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.32.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.32.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.33.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.33.layer_scalar": "model.safetensors",
+ "language_model.model.layers.33.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.33.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.33.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.33.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.33.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.33.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.33.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.33.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.33.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.33.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.33.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.33.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.33.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.33.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.33.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.33.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.33.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.33.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.33.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.33.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.33.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.33.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.33.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.33.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.33.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.33.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.33.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.33.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.33.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.33.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.33.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.33.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.33.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.34.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.34.layer_scalar": "model.safetensors",
+ "language_model.model.layers.34.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.34.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.34.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.34.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.34.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.34.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.34.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.34.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.34.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.34.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.34.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.34.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.34.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.34.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.34.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.34.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.34.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.34.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.34.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.34.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.34.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.34.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.34.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.34.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.34.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.34.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.34.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.34.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.34.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.34.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.34.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.34.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.34.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.4.layer_scalar": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.4.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.4.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.4.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.4.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.4.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.4.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.4.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.4.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.4.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.4.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.4.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.4.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.5.layer_scalar": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.5.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.5.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.5.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.5.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.5.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.5.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.5.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.5.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.5.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.5.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.5.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.5.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.6.layer_scalar": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.6.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.6.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.6.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.6.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.6.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.6.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.6.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.6.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.6.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.6.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.6.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.6.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.layer_scalar": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.7.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.7.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.7.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.7.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.7.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.7.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.7.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.8.layer_scalar": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.8.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.8.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.8.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.8.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.8.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.8.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.8.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.8.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.8.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.8.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.8.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.8.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.9.layer_scalar": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.9.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.9.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.9.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.9.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.9.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.9.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.9.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.9.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.9.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.9.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.9.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.9.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.norm.weight": "model.safetensors",
+ "language_model.model.per_layer_model_projection.weight": "model.safetensors",
+ "language_model.model.per_layer_projection_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.patch_embedder.input_proj.weight": "model.safetensors",
+ "vision_tower.patch_embedder.position_embedding_table": "model.safetensors"
+ }
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/processor_config.json b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/processor_config.json
new file mode 100644
index 0000000..13e92a4
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/processor_config.json
@@ -0,0 +1,42 @@
+{
+ "audio_seq_length": 750,
+ "image_processor": {
+ "do_convert_rgb": true,
+ "do_normalize": false,
+ "do_rescale": true,
+ "do_resize": true,
+ "image_mean": [
+ 0.0,
+ 0.0,
+ 0.0
+ ],
+ "image_processor_type": "Gemma4ImageProcessor",
+ "image_seq_length": 280,
+ "image_std": [
+ 1.0,
+ 1.0,
+ 1.0
+ ],
+ "max_soft_tokens": 280,
+ "patch_size": 16,
+ "pooling_kernel_size": 3,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "size": {
+ "height": 224,
+ "width": 224
+ }
+ },
+ "image_seq_length": 280,
+ "processor_class": "Gemma4Processor",
+ "feature_extractor": {
+ "feature_extractor_type": "Gemma4AudioFeatureExtractor",
+ "sampling_rate": 16000,
+ "num_mel_filters": 128,
+ "fft_length": 512,
+ "hop_length": 160,
+ "chunk_duration": 8.0,
+ "overlap_duration": 1.0
+ },
+ "audio_ms_per_token": 40
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/tokenizer.json b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/tokenizer.json
new file mode 100644
index 0000000..1ff9f3e
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:cc8d3a0ce36466ccc1278bf987df5f71db1719b9ca6b4118264f45cb627bfe0f
+size 32169626
diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/tokenizer_config.json b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/tokenizer_config.json
new file mode 100644
index 0000000..375b25d
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/tokenizer_config.json
@@ -0,0 +1,74 @@
+{
+ "audio_token": "<|audio|>",
+ "backend": "tokenizers",
+ "boa_token": "<|audio>",
+ "boi_token": "<|image>",
+ "bos_token": "",
+ "eoa_token": "",
+ "eoc_token": "",
+ "eoi_token": "",
+ "eos_token": "",
+ "eot_token": "",
+ "escape_token": "<|\"|>",
+ "etc_token": "",
+ "etd_token": "",
+ "etr_token": "",
+ "extra_special_tokens": [
+ "<|video|>"
+ ],
+ "image_token": "<|image|>",
+ "mask_token": "",
+ "model_max_length": 1000000000000000019884624838656,
+ "pad_token": "",
+ "padding_side": "left",
+ "processor_class": "Gemma4Processor",
+ "response_schema": {
+ "type": "object",
+ "properties": {
+ "role": {
+ "const": "assistant"
+ },
+ "thinking": {
+ "type": "string"
+ },
+ "content": {
+ "type": "string"
+ },
+ "tool_calls": {
+ "x-regex-iterator": "<\\|tool_call>(.*?)",
+ "type": "array",
+ "items": {
+ "type": "object",
+ "properties": {
+ "type": {
+ "const": "function"
+ },
+ "function": {
+ "type": "object",
+ "x-regex": "call\\:(?P\\w+)(?P\\{.*\\})",
+ "properties": {
+ "name": {
+ "type": "string"
+ },
+ "arguments": {
+ "type": "object",
+ "x-parser": "gemma4-tool-call",
+ "additionalProperties": {}
+ }
+ }
+ }
+ }
+ }
+ }
+ },
+ "x-regex": "(\\<\\|channel\\>thought\\n(?P.*?)\\)?(?P\\<\\|tool_call\\>.*\\)?(?P(?:(?!\\)(?!\\<\\|tool_response\\>).)+)?(?:\\|\\<\\|tool_response\\>)?"
+ },
+ "soc_token": "<|channel>",
+ "sot_token": "<|turn>",
+ "stc_token": "<|tool_call>",
+ "std_token": "<|tool>",
+ "str_token": "<|tool_response>",
+ "think_token": "<|think|>",
+ "tokenizer_class": "GemmaTokenizer",
+ "unk_token": ""
+}
diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/.gitattributes b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/.gitattributes
new file mode 100644
index 0000000..52373fe
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/.gitattributes
@@ -0,0 +1,36 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/README.md b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/README.md
new file mode 100644
index 0000000..c33c32d
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/README.md
@@ -0,0 +1,25 @@
+---
+library_name: mlx
+license: apache-2.0
+license_link: https://ai.google.dev/gemma/docs/gemma_4_license
+pipeline_tag: any-to-any
+base_model: google/gemma-4-e4b-it
+tags:
+- mlx
+---
+
+# mlx-community/gemma-4-e4b-it-4bit
+
+This model was converted to MLX format from [`google/gemma-4-e4b-it`](https://huggingface.co/google/gemma-4-e4b-it)
+using mlx-vlm version **0.4.3**.
+Refer to the [original model card](https://huggingface.co/google/gemma-4-e4b-it) for more details on the model.
+
+## Use with mlx
+
+```bash
+pip install -U mlx-vlm
+```
+
+```bash
+python -m mlx_vlm.generate --model mlx-community/gemma-4-e4b-it-4bit --max-tokens 100 --temperature 0.0 --prompt "Describe this image." --image
+```
diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/chat_template.jinja b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/chat_template.jinja
new file mode 100644
index 0000000..c19999a
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/chat_template.jinja
@@ -0,0 +1,360 @@
+{%- macro format_parameters(properties, required, filter_keys=false) -%}
+ {%- set standard_keys = ['description', 'type', 'properties', 'required', 'nullable'] -%}
+ {%- set ns = namespace(found_first=false) -%}
+ {%- for key, value in properties | dictsort -%}
+ {%- set add_comma = false -%}
+ {%- if not filter_keys or key not in standard_keys -%}
+ {%- if ns.found_first %},{% endif -%}
+ {%- set ns.found_first = true -%}
+ {{ key }}:{
+ {%- if value['description'] -%}
+ description:<|"|>{{ value['description'] }}<|"|>
+ {%- set add_comma = true -%}
+ {%- endif -%}
+ {%- if value['type'] | upper == 'STRING' -%}
+ {%- if value['enum'] -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ enum:{{ format_argument(value['enum']) }}
+ {%- endif -%}
+ {%- elif value['type'] | upper == 'ARRAY' -%}
+ {%- if value['items'] is mapping and value['items'] -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ items:{
+ {%- set ns_items = namespace(found_first=false) -%}
+ {%- for item_key, item_value in value['items'] | dictsort -%}
+ {%- if item_value is not none -%}
+ {%- if ns_items.found_first %},{% endif -%}
+ {%- set ns_items.found_first = true -%}
+ {%- if item_key == 'properties' -%}
+ properties:{
+ {%- if item_value is mapping -%}
+ {{- format_parameters(item_value, value['items']['required'] | default([])) -}}
+ {%- endif -%}
+ }
+ {%- elif item_key == 'required' -%}
+ required:[
+ {%- for req_item in item_value -%}
+ <|"|>{{- req_item -}}<|"|>
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ ]
+ {%- elif item_key == 'type' -%}
+ {%- if item_value is string -%}
+ type:{{ format_argument(item_value | upper) }}
+ {%- else -%}
+ type:{{ format_argument(item_value | map('upper') | list) }}
+ {%- endif -%}
+ {%- else -%}
+ {{ item_key }}:{{ format_argument(item_value) }}
+ {%- endif -%}
+ {%- endif -%}
+ {%- endfor -%}
+ }
+ {%- endif -%}
+ {%- endif -%}
+ {%- if value['nullable'] %}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ nullable:true
+ {%- endif -%}
+ {%- if value['type'] | upper == 'OBJECT' -%}
+ {%- if value['properties'] is defined and value['properties'] is mapping -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ properties:{
+ {{- format_parameters(value['properties'], value['required'] | default([])) -}}
+ }
+ {%- elif value is mapping -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ properties:{
+ {{- format_parameters(value, value['required'] | default([]), filter_keys=true) -}}
+ }
+ {%- endif -%}
+ {%- if value['required'] -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ required:[
+ {%- for item in value['required'] | default([]) -%}
+ <|"|>{{- item -}}<|"|>
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ ]
+ {%- endif -%}
+ {%- endif -%}
+ {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%}
+ type:<|"|>{{ value['type'] | upper }}<|"|>}
+ {%- endif -%}
+ {%- endfor -%}
+{%- endmacro -%}
+{%- macro format_function_declaration(tool_data) -%}
+ declaration:{{- tool_data['function']['name'] -}}{description:<|"|>{{- tool_data['function']['description'] -}}<|"|>
+ {%- set params = tool_data['function']['parameters'] -%}
+ {%- if params -%}
+ ,parameters:{
+ {%- if params['properties'] -%}
+ properties:{ {{- format_parameters(params['properties'], params['required']) -}} },
+ {%- endif -%}
+ {%- if params['required'] -%}
+ required:[
+ {%- for item in params['required'] -%}
+ <|"|>{{- item -}}<|"|>
+ {{- ',' if not loop.last -}}
+ {%- endfor -%}
+ ],
+ {%- endif -%}
+ {%- if params['type'] -%}
+ type:<|"|>{{- params['type'] | upper -}}<|"|>}
+ {%- endif -%}
+ {%- endif -%}
+ {%- if 'response' in tool_data['function'] -%}
+ {%- set response_declaration = tool_data['function']['response'] -%}
+ ,response:{
+ {%- if response_declaration['description'] -%}
+ description:<|"|>{{- response_declaration['description'] -}}<|"|>,
+ {%- endif -%}
+ {%- if response_declaration['type'] | upper == 'OBJECT' -%}
+ type:<|"|>{{- response_declaration['type'] | upper -}}<|"|>}
+ {%- endif -%}
+ {%- endif -%}
+ }
+{%- endmacro -%}
+{%- macro format_argument(argument, escape_keys=True) -%}
+ {%- if argument is string -%}
+ {{- '<|"|>' + argument + '<|"|>' -}}
+ {%- elif argument is boolean -%}
+ {{- 'true' if argument else 'false' -}}
+ {%- elif argument is mapping -%}
+ {{- '{' -}}
+ {%- set ns = namespace(found_first=false) -%}
+ {%- for key, value in argument | dictsort -%}
+ {%- if ns.found_first %},{% endif -%}
+ {%- set ns.found_first = true -%}
+ {%- if escape_keys -%}
+ {{- '<|"|>' + key + '<|"|>' -}}
+ {%- else -%}
+ {{- key -}}
+ {%- endif -%}
+ :{{- format_argument(value, escape_keys=escape_keys) -}}
+ {%- endfor -%}
+ {{- '}' -}}
+ {%- elif argument is sequence -%}
+ {{- '[' -}}
+ {%- for item in argument -%}
+ {{- format_argument(item, escape_keys=escape_keys) -}}
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ {{- ']' -}}
+ {%- else -%}
+ {{- argument -}}
+ {%- endif -%}
+{%- endmacro -%}
+{%- macro strip_thinking(text) -%}
+ {%- set ns = namespace(result='') -%}
+ {%- for part in text.split('') -%}
+ {%- if '<|channel>' in part -%}
+ {%- set ns.result = ns.result + part.split('<|channel>')[0] -%}
+ {%- else -%}
+ {%- set ns.result = ns.result + part -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {{- ns.result | trim -}}
+{%- endmacro -%}
+
+{%- macro format_tool_response_block(tool_name, response) -%}
+ {{- '<|tool_response>' -}}
+ {%- if response is mapping -%}
+ {{- 'response:' + tool_name + '{' -}}
+ {%- for key, value in response | dictsort -%}
+ {{- key -}}:{{- format_argument(value, escape_keys=False) -}}
+ {%- if not loop.last %},{% endif -%}
+ {%- endfor -%}
+ {{- '}' -}}
+ {%- else -%}
+ {{- 'response:' + tool_name + '{value:' + format_argument(response, escape_keys=False) + '}' -}}
+ {%- endif -%}
+ {{- '' -}}
+{%- endmacro -%}
+
+{%- set ns = namespace(prev_message_type=None) -%}
+{%- set loop_messages = messages -%}
+{{- bos_token -}}
+{#- Handle System/Tool Definitions Block -#}
+{%- if (enable_thinking is defined and enable_thinking) or tools or messages[0]['role'] in ['system', 'developer'] -%}
+ {{- '<|turn>system\n' -}}
+ {#- Inject Thinking token at the very top of the FIRST system turn -#}
+ {%- if enable_thinking is defined and enable_thinking -%}
+ {{- '<|think|>\n' -}}
+ {%- set ns.prev_message_type = 'think' -%}
+ {%- endif -%}
+ {%- if messages[0]['role'] in ['system', 'developer'] -%}
+ {%- if messages[0]['content'] is string -%}
+ {{- messages[0]['content'] | trim -}}
+ {%- elif messages[0]['content'] is sequence -%}
+ {%- for item in messages[0]['content'] -%}
+ {{- item['text'] | trim + ' '-}}
+ {%- endfor -%}
+ {%- endif -%}
+ {%- set loop_messages = messages[1:] -%}
+ {%- endif -%}
+ {%- if tools -%}
+ {%- for tool in tools %}
+ {{- '<|tool>' -}}
+ {{- format_function_declaration(tool) | trim -}}
+ {{- '' -}}
+ {%- endfor %}
+ {%- set ns.prev_message_type = 'tool' -%}
+ {%- endif -%}
+ {{- '\n' -}}
+{%- endif %}
+
+{#- Pre-scan: find last user message index for reasoning guard -#}
+{%- set ns_turn = namespace(last_user_idx=-1) -%}
+{%- for i in range(loop_messages | length) -%}
+ {%- if loop_messages[i]['role'] == 'user' -%}
+ {%- set ns_turn.last_user_idx = i -%}
+ {%- endif -%}
+{%- endfor -%}
+
+{#- Loop through messages -#}
+{%- for message in loop_messages -%}
+ {%- if message['role'] != 'tool' -%}
+ {%- set ns.prev_message_type = None -%}
+ {%- set role = 'model' if message['role'] == 'assistant' else message['role'] -%}
+ {#- Detect continuation: suppress duplicate <|turn>model when previous non-tool message was also assistant -#}
+ {%- set prev_nt = namespace(role=None, found=false) -%}
+ {%- if loop.index0 > 0 -%}
+ {%- for j in range(loop.index0 - 1, -1, -1) -%}
+ {%- if not prev_nt.found -%}
+ {%- if loop_messages[j]['role'] != 'tool' -%}
+ {%- set prev_nt.role = loop_messages[j]['role'] -%}
+ {%- set prev_nt.found = true -%}
+ {%- endif -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- endif -%}
+ {%- set continue_same_model_turn = (role == 'model' and prev_nt.role == 'assistant') -%}
+ {%- if not continue_same_model_turn -%}
+ {{- '<|turn>' + role + '\n' }}
+ {%- endif -%}
+
+ {#- Render reasoning/reasoning_content as thinking channel -#}
+ {%- set thinking_text = message.get('reasoning') or message.get('reasoning_content') -%}
+ {%- if thinking_text and loop.index0 > ns_turn.last_user_idx and message.get('tool_calls') -%}
+ {{- '<|channel>thought\n' + thinking_text + '\n' -}}
+ {%- endif -%}
+
+ {%- if message['tool_calls'] -%}
+ {%- for tool_call in message['tool_calls'] -%}
+ {%- set function = tool_call['function'] -%}
+ {{- '<|tool_call>call:' + function['name'] + '{' -}}
+ {%- if function['arguments'] is mapping -%}
+ {%- set ns_args = namespace(found_first=false) -%}
+ {%- for key, value in function['arguments'] | dictsort -%}
+ {%- if ns_args.found_first %},{% endif -%}
+ {%- set ns_args.found_first = true -%}
+ {{- key -}}:{{- format_argument(value, escape_keys=False) -}}
+ {%- endfor -%}
+ {%- elif function['arguments'] is string -%}
+ {{- function['arguments'] -}}
+ {%- endif -%}
+ {{- '}' -}}
+ {%- endfor -%}
+ {%- set ns.prev_message_type = 'tool_call' -%}
+ {%- endif -%}
+
+ {%- set ns_tr_out = namespace(flag=false) -%}
+ {%- if message.get('tool_responses') -%}
+ {#- Legacy: tool_responses embedded on the assistant message (Google/Gemma native) -#}
+ {%- for tool_response in message['tool_responses'] -%}
+ {{- format_tool_response_block(tool_response['name'] | default('unknown'), tool_response['response']) -}}
+ {%- set ns_tr_out.flag = true -%}
+ {%- set ns.prev_message_type = 'tool_response' -%}
+ {%- endfor -%}
+ {%- elif message.get('tool_calls') -%}
+ {#- OpenAI Chat Completions: forward-scan consecutive role:tool messages -#}
+ {%- set ns_tool_scan = namespace(stopped=false) -%}
+ {%- for k in range(loop.index0 + 1, loop_messages | length) -%}
+ {%- if ns_tool_scan.stopped -%}
+ {%- elif loop_messages[k]['role'] != 'tool' -%}
+ {%- set ns_tool_scan.stopped = true -%}
+ {%- else -%}
+ {%- set follow = loop_messages[k] -%}
+ {#- Resolve tool_call_id to function name -#}
+ {%- set ns_tname = namespace(name=follow.get('name') | default('unknown')) -%}
+ {%- for tc in message['tool_calls'] -%}
+ {%- if tc.get('id') == follow.get('tool_call_id') -%}
+ {%- set ns_tname.name = tc['function']['name'] -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {#- Handle content as string or content-parts array -#}
+ {%- set tool_body = follow.get('content') -%}
+ {%- if tool_body is string -%}
+ {{- format_tool_response_block(ns_tname.name, tool_body) -}}
+ {%- elif tool_body is sequence and tool_body is not string -%}
+ {%- set ns_txt = namespace(s='') -%}
+ {%- for part in tool_body -%}
+ {%- if part.get('type') == 'text' -%}
+ {%- set ns_txt.s = ns_txt.s + (part.get('text') | default('')) -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {{- format_tool_response_block(ns_tname.name, ns_txt.s) -}}
+ {%- for part in tool_body -%}
+ {%- if part.get('type') == 'image' -%}
+ {{- '<|image|>' -}}
+ {%- elif part.get('type') == 'audio' -%}
+ {{- '<|audio|>' -}}
+ {%- elif part.get('type') == 'video' -%}
+ {{- '<|video|>' -}}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- else -%}
+ {{- format_tool_response_block(ns_tname.name, tool_body) -}}
+ {%- endif -%}
+ {%- set ns_tr_out.flag = true -%}
+ {%- set ns.prev_message_type = 'tool_response' -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- endif -%}
+
+ {%- set captured_content -%}
+ {%- if message['content'] is string -%}
+ {%- if role == 'model' -%}
+ {{- strip_thinking(message['content']) -}}
+ {%- else -%}
+ {{- message['content'] | trim -}}
+ {%- endif -%}
+ {%- elif message['content'] is sequence -%}
+ {%- for item in message['content'] -%}
+ {%- if item['type'] == 'text' -%}
+ {%- if role == 'model' -%}
+ {{- strip_thinking(item['text']) -}}
+ {%- else -%}
+ {{- item['text'] | trim -}}
+ {%- endif -%}
+ {%- elif item['type'] == 'image' -%}
+ {{- '<|image|>' -}}
+ {%- set ns.prev_message_type = 'image' -%}
+ {%- elif item['type'] == 'audio' -%}
+ {{- '<|audio|>' -}}
+ {%- set ns.prev_message_type = 'audio' -%}
+ {%- elif item['type'] == 'video' -%}
+ {{- '<|video|>' -}}
+ {%- set ns.prev_message_type = 'video' -%}
+ {%- endif -%}
+ {%- endfor -%}
+ {%- endif -%}
+ {%- endset -%}
+
+ {{- captured_content -}}
+ {%- set has_content = captured_content | trim | length > 0 -%}
+
+ {%- if ns.prev_message_type == 'tool_call' and not ns_tr_out.flag -%}
+ {{- '<|tool_response>' -}}
+ {%- elif not (ns_tr_out.flag and not has_content) -%}
+ {{- '\n' -}}
+ {%- endif -%}
+ {%- endif -%}
+{%- endfor -%}
+
+{%- if add_generation_prompt -%}
+ {%- if ns.prev_message_type != 'tool_response' and ns.prev_message_type != 'tool_call' -%}
+ {{- '<|turn>model\n' -}}
+ {%- endif -%}
+{%- endif -%}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/config.json b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/config.json
new file mode 100644
index 0000000..2bd7183
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/config.json
@@ -0,0 +1,208 @@
+{
+ "architectures": [
+ "Gemma4ForConditionalGeneration"
+ ],
+ "audio_config": {
+ "_name_or_path": "",
+ "architectures": null,
+ "attention_chunk_size": 12,
+ "attention_context_left": 13,
+ "attention_context_right": 0,
+ "attention_invalid_logits_value": -1000000000.0,
+ "attention_logit_cap": 50.0,
+ "chunk_size_feed_forward": 0,
+ "conv_kernel_size": 5,
+ "dtype": "bfloat16",
+ "gradient_clipping": 10000000000.0,
+ "hidden_act": "silu",
+ "hidden_size": 1024,
+ "id2label": {
+ "0": "LABEL_0",
+ "1": "LABEL_1"
+ },
+ "initializer_range": 0.02,
+ "is_encoder_decoder": false,
+ "label2id": {
+ "LABEL_0": 0,
+ "LABEL_1": 1
+ },
+ "model_type": "gemma4_audio",
+ "num_attention_heads": 8,
+ "num_hidden_layers": 12,
+ "output_attentions": false,
+ "output_hidden_states": false,
+ "output_proj_dims": 1536,
+ "problem_type": null,
+ "residual_weight": 0.5,
+ "return_dict": true,
+ "rms_norm_eps": 1e-06,
+ "subsampling_conv_channels": [
+ 128,
+ 32
+ ],
+ "use_clipped_linears": true
+ },
+ "audio_token_id": 258881,
+ "boa_token_id": 256000,
+ "boi_token_id": 255999,
+ "dtype": "bfloat16",
+ "eoa_token_id": 258883,
+ "eoa_token_index": 258883,
+ "eoi_token_id": 258882,
+ "eos_token_id": [
+ 1,
+ 106,
+ 50
+ ],
+ "image_token_id": 258880,
+ "initializer_range": 0.02,
+ "model_type": "gemma4",
+ "quantization": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine"
+ },
+ "quantization_config": {
+ "group_size": 64,
+ "bits": 4,
+ "mode": "affine"
+ },
+ "text_config": {
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "attention_k_eq_v": false,
+ "bos_token_id": 2,
+ "dtype": "bfloat16",
+ "enable_moe_block": false,
+ "eos_token_id": 1,
+ "expert_intermediate_size": null,
+ "final_logit_softcapping": 30.0,
+ "global_head_dim": 512,
+ "head_dim": 256,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 2560,
+ "hidden_size_per_layer_input": 256,
+ "initializer_range": 0.02,
+ "intermediate_size": 10240,
+ "layer_types": [
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "sliding_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 131072,
+ "model_type": "gemma4_text",
+ "num_attention_heads": 8,
+ "num_experts": null,
+ "num_global_key_value_heads": null,
+ "num_hidden_layers": 42,
+ "num_key_value_heads": 2,
+ "num_kv_shared_layers": 18,
+ "pad_token_id": 0,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "full_attention": {
+ "partial_rotary_factor": 0.25,
+ "rope_theta": 1000000.0,
+ "rope_type": "proportional"
+ },
+ "sliding_attention": {
+ "rope_theta": 10000.0,
+ "rope_type": "default"
+ }
+ },
+ "sliding_window": 512,
+ "tie_word_embeddings": true,
+ "top_k_experts": null,
+ "use_bidirectional_attention": null,
+ "use_cache": true,
+ "use_double_wide_mlp": false,
+ "vocab_size": 262144,
+ "vocab_size_per_layer_input": 262144
+ },
+ "tie_word_embeddings": true,
+ "transformers_version": "5.5.0.dev0",
+ "video_token_id": 258884,
+ "vision_config": {
+ "_name_or_path": "",
+ "architectures": null,
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "chunk_size_feed_forward": 0,
+ "default_output_length": 280,
+ "dtype": "bfloat16",
+ "global_head_dim": 64,
+ "head_dim": 64,
+ "hidden_activation": "gelu_pytorch_tanh",
+ "hidden_size": 768,
+ "id2label": {
+ "0": "LABEL_0",
+ "1": "LABEL_1"
+ },
+ "initializer_range": 0.02,
+ "intermediate_size": 3072,
+ "is_encoder_decoder": false,
+ "label2id": {
+ "LABEL_0": 0,
+ "LABEL_1": 1
+ },
+ "max_position_embeddings": 131072,
+ "model_type": "gemma4_vision",
+ "num_attention_heads": 12,
+ "num_hidden_layers": 16,
+ "num_key_value_heads": 12,
+ "output_attentions": false,
+ "output_hidden_states": false,
+ "patch_size": 16,
+ "pooling_kernel_size": 3,
+ "position_embedding_size": 10240,
+ "problem_type": null,
+ "return_dict": true,
+ "rms_norm_eps": 1e-06,
+ "rope_parameters": {
+ "rope_theta": 100.0,
+ "rope_type": "default"
+ },
+ "standardize": false,
+ "use_clipped_linears": true
+ },
+ "vision_soft_tokens_per_image": 280
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/generation_config.json b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/generation_config.json
new file mode 100644
index 0000000..e605bb4
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/generation_config.json
@@ -0,0 +1,14 @@
+{
+ "bos_token_id": 2,
+ "do_sample": true,
+ "eos_token_id": [
+ 1,
+ 106,
+ 50
+ ],
+ "pad_token_id": 0,
+ "temperature": 1.0,
+ "top_k": 64,
+ "top_p": 0.95,
+ "transformers_version": "5.5.0.dev0"
+}
diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/model.safetensors b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/model.safetensors
new file mode 100644
index 0000000..f80840c
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:339409bd18494955556e1fde6ccc15faaa9f707b911b74791fe290b9d722beed
+size 5217361182
diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/model.safetensors.index.json
new file mode 100644
index 0000000..81d2aa1
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/model.safetensors.index.json
@@ -0,0 +1,2901 @@
+{
+ "metadata": {
+ "total_size": 5216992212
+ },
+ "weight_map": {
+ "audio_tower.layers.0.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.0.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.0.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.0.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.0.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.0.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.0.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.0.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.0.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.0.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.0.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.0.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.0.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.0.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.0.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.0.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.0.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.0.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.0.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.1.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.1.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.1.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.1.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.1.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.1.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.1.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.1.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.1.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.1.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.1.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.1.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.1.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.1.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.1.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.1.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.1.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.1.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.10.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.10.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.10.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.10.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.10.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.10.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.10.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.10.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.10.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.10.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.10.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.10.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.10.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.10.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.10.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.10.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.10.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.10.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.11.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.11.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.11.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.11.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.11.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.11.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.11.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.11.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.11.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.11.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.11.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.11.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.11.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.11.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.11.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.11.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.11.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.11.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.2.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.2.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.2.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.2.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.2.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.2.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.2.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.2.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.2.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.2.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.2.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.2.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.2.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.2.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.2.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.2.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.2.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.2.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.3.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.3.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.3.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.3.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.3.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.3.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.3.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.3.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.3.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.3.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.3.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.3.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.3.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.3.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.3.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.3.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.3.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.3.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.4.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.4.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.4.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.4.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.4.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.4.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.4.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.4.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.4.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.4.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.4.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.4.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.4.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.4.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.4.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.4.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.4.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.4.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.5.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.5.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.5.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.5.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.5.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.5.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.5.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.5.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.5.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.5.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.5.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.5.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.5.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.5.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.5.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.5.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.5.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.5.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.6.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.6.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.6.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.6.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.6.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.6.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.6.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.6.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.6.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.6.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.6.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.6.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.6.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.6.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.6.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.6.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.6.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.6.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.7.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.7.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.7.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.7.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.7.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.7.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.7.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.7.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.7.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.7.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.7.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.7.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.7.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.7.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.7.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.7.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.7.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.7.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.8.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.8.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.8.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.8.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.8.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.8.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.8.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.8.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.8.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.8.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.8.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.8.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.8.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.8.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.8.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.8.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.8.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.8.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.9.feed_forward1.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_1.input_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_1.input_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_1.output_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_1.output_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_2.input_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_2.input_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_2.output_max": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.ffw_layer_2.output_min": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.post_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.9.feed_forward2.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.conv_norm.weight": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.depthwise_conv1d.weight": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_end.input_max": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_end.input_min": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_end.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_end.output_max": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_end.output_min": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_start.input_max": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_start.input_min": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_start.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_start.output_max": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.linear_start.output_min": "model.safetensors",
+ "audio_tower.layers.9.lconv1d.pre_layer_norm.weight": "model.safetensors",
+ "audio_tower.layers.9.norm_out.weight": "model.safetensors",
+ "audio_tower.layers.9.norm_post_attn.weight": "model.safetensors",
+ "audio_tower.layers.9.norm_pre_attn.weight": "model.safetensors",
+ "audio_tower.layers.9.self_attn.k_proj.input_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.k_proj.input_min": "model.safetensors",
+ "audio_tower.layers.9.self_attn.k_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.self_attn.k_proj.output_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.k_proj.output_min": "model.safetensors",
+ "audio_tower.layers.9.self_attn.per_dim_scale": "model.safetensors",
+ "audio_tower.layers.9.self_attn.post.input_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.post.input_min": "model.safetensors",
+ "audio_tower.layers.9.self_attn.post.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.self_attn.post.output_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.post.output_min": "model.safetensors",
+ "audio_tower.layers.9.self_attn.q_proj.input_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.q_proj.input_min": "model.safetensors",
+ "audio_tower.layers.9.self_attn.q_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.self_attn.q_proj.output_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.q_proj.output_min": "model.safetensors",
+ "audio_tower.layers.9.self_attn.relative_k_proj.weight": "model.safetensors",
+ "audio_tower.layers.9.self_attn.v_proj.input_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.v_proj.input_min": "model.safetensors",
+ "audio_tower.layers.9.self_attn.v_proj.linear.weight": "model.safetensors",
+ "audio_tower.layers.9.self_attn.v_proj.output_max": "model.safetensors",
+ "audio_tower.layers.9.self_attn.v_proj.output_min": "model.safetensors",
+ "audio_tower.output_proj.bias": "model.safetensors",
+ "audio_tower.output_proj.weight": "model.safetensors",
+ "audio_tower.subsample_conv_projection.input_proj_linear.weight": "model.safetensors",
+ "audio_tower.subsample_conv_projection.layer0.conv.weight": "model.safetensors",
+ "audio_tower.subsample_conv_projection.layer0.norm.weight": "model.safetensors",
+ "audio_tower.subsample_conv_projection.layer1.conv.weight": "model.safetensors",
+ "audio_tower.subsample_conv_projection.layer1.norm.weight": "model.safetensors",
+ "embed_audio.embedding_projection.biases": "model.safetensors",
+ "embed_audio.embedding_projection.scales": "model.safetensors",
+ "embed_audio.embedding_projection.weight": "model.safetensors",
+ "embed_vision.embedding_projection.biases": "model.safetensors",
+ "embed_vision.embedding_projection.scales": "model.safetensors",
+ "embed_vision.embedding_projection.weight": "model.safetensors",
+ "language_model.model.embed_tokens.biases": "model.safetensors",
+ "language_model.model.embed_tokens.scales": "model.safetensors",
+ "language_model.model.embed_tokens.weight": "model.safetensors",
+ "language_model.model.embed_tokens_per_layer.biases": "model.safetensors",
+ "language_model.model.embed_tokens_per_layer.scales": "model.safetensors",
+ "language_model.model.embed_tokens_per_layer.weight": "model.safetensors",
+ "language_model.model.layers.0.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.0.layer_scalar": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.0.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.0.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.0.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.0.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.0.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.0.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.0.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.0.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.0.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.0.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.0.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.0.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.0.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.0.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.0.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.1.layer_scalar": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.1.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.1.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.1.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.1.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.1.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.1.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.1.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.1.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.1.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.1.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.1.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.1.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.1.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.1.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.1.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.10.layer_scalar": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.10.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.10.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.10.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.10.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.10.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.10.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.10.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.10.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.10.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.10.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.10.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.10.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.10.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.10.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.10.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.layer_scalar": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.11.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.11.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.11.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.11.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.11.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.11.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.11.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.11.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.12.layer_scalar": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.12.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.12.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.12.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.12.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.12.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.12.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.12.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.12.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.12.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.12.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.12.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.12.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.12.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.12.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.12.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.13.layer_scalar": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.13.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.13.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.13.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.13.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.13.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.13.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.13.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.13.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.13.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.13.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.13.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.13.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.13.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.13.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.13.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.14.layer_scalar": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.14.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.14.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.14.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.14.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.14.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.14.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.14.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.14.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.14.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.14.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.14.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.14.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.14.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.14.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.14.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.layer_scalar": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.15.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.15.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.15.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.15.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.15.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.15.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.15.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.15.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.16.layer_scalar": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.16.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.16.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.16.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.16.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.16.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.16.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.16.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.16.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.16.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.16.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.16.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.16.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.16.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.16.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.16.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.17.layer_scalar": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.17.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.17.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.17.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.17.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.17.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.17.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.17.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.17.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.17.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.17.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.17.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.17.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.17.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.17.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.17.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.18.layer_scalar": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.18.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.18.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.18.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.18.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.18.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.18.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.18.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.18.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.18.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.18.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.18.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.18.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.18.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.18.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.18.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.layer_scalar": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.19.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.19.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.19.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.19.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.19.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.19.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.19.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.19.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.2.layer_scalar": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.2.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.2.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.2.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.2.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.2.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.2.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.2.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.2.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.2.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.2.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.2.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.2.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.2.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.2.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.2.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.20.layer_scalar": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.20.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.20.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.20.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.20.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.20.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.20.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.20.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.20.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.20.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.20.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.20.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.20.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.20.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.20.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.20.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.21.layer_scalar": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.21.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.21.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.21.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.21.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.21.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.21.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.21.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.21.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.21.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.21.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.21.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.21.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.21.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.21.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.21.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.22.layer_scalar": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.22.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.22.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.22.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.22.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.22.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.22.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.22.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.22.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.22.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.22.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.22.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.22.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.22.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.22.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.22.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.layer_scalar": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.23.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.23.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.23.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.23.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.23.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.23.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.23.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.23.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.24.layer_scalar": "model.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.24.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.24.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.24.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.24.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.24.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.24.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.24.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.24.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.24.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.24.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.24.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.24.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.24.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.24.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.24.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.25.layer_scalar": "model.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.25.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.25.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.25.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.25.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.25.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.25.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.25.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.25.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.25.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.25.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.25.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.25.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.25.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.25.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.25.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.26.layer_scalar": "model.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.26.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.26.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.26.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.26.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.26.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.26.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.26.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.26.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.26.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.26.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.26.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.26.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.26.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.26.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.26.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.27.layer_scalar": "model.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.27.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.27.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.27.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.27.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.27.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.27.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.27.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.27.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.27.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.27.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.28.layer_scalar": "model.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.28.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.28.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.28.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.28.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.28.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.28.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.28.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.28.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.28.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.28.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.28.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.28.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.28.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.28.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.28.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.29.layer_scalar": "model.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.29.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.29.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.29.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.29.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.29.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.29.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.29.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.29.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.29.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.29.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.29.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.29.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.29.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.29.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.29.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.layer_scalar": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.3.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.3.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.3.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.3.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.3.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.3.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.3.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.3.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.30.layer_scalar": "model.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.30.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.30.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.30.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.30.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.30.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.30.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.30.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.30.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.30.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.30.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.30.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.30.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.30.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.30.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.30.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.31.layer_scalar": "model.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.31.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.31.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.31.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.31.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.31.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.31.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.31.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.31.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.31.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.31.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.32.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.32.layer_scalar": "model.safetensors",
+ "language_model.model.layers.32.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.32.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.32.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.32.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.32.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.32.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.32.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.32.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.32.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.32.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.32.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.32.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.32.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.32.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.32.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.32.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.32.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.32.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.32.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.32.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.32.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.32.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.32.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.32.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.32.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.32.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.32.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.32.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.32.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.32.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.32.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.32.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.32.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.33.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.33.layer_scalar": "model.safetensors",
+ "language_model.model.layers.33.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.33.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.33.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.33.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.33.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.33.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.33.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.33.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.33.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.33.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.33.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.33.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.33.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.33.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.33.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.33.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.33.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.33.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.33.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.33.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.33.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.33.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.33.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.33.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.33.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.33.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.33.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.33.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.33.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.33.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.33.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.33.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.33.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.34.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.34.layer_scalar": "model.safetensors",
+ "language_model.model.layers.34.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.34.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.34.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.34.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.34.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.34.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.34.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.34.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.34.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.34.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.34.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.34.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.34.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.34.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.34.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.34.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.34.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.34.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.34.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.34.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.34.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.34.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.34.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.34.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.34.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.34.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.34.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.34.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.34.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.34.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.34.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.34.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.34.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.35.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.35.layer_scalar": "model.safetensors",
+ "language_model.model.layers.35.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.35.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.35.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.35.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.35.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.35.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.35.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.35.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.35.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.35.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.35.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.35.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.35.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.35.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.35.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.35.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.35.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.35.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.35.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.35.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.35.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.35.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.35.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.35.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.35.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.35.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.35.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.35.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.35.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.35.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.35.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.35.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.35.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.36.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.36.layer_scalar": "model.safetensors",
+ "language_model.model.layers.36.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.36.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.36.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.36.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.36.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.36.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.36.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.36.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.36.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.36.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.36.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.36.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.36.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.36.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.36.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.36.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.36.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.36.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.36.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.36.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.36.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.36.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.36.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.36.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.36.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.36.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.36.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.36.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.36.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.36.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.36.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.36.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.36.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.37.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.37.layer_scalar": "model.safetensors",
+ "language_model.model.layers.37.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.37.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.37.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.37.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.37.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.37.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.37.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.37.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.37.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.37.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.37.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.37.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.37.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.37.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.37.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.37.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.37.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.37.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.37.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.37.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.37.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.37.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.37.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.37.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.37.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.37.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.37.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.37.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.37.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.37.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.37.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.37.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.37.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.38.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.38.layer_scalar": "model.safetensors",
+ "language_model.model.layers.38.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.38.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.38.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.38.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.38.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.38.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.38.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.38.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.38.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.38.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.38.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.38.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.38.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.38.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.38.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.38.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.38.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.38.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.38.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.38.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.38.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.38.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.38.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.38.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.38.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.38.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.38.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.38.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.38.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.38.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.38.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.38.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.38.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.39.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.39.layer_scalar": "model.safetensors",
+ "language_model.model.layers.39.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.39.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.39.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.39.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.39.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.39.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.39.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.39.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.39.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.39.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.39.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.39.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.39.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.39.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.39.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.39.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.39.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.39.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.39.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.39.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.39.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.39.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.39.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.39.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.39.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.39.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.39.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.39.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.39.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.39.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.39.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.39.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.39.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.4.layer_scalar": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.4.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.4.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.4.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.4.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.4.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.4.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.4.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.4.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.4.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.4.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.4.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.4.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.4.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.4.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.4.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.40.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.40.layer_scalar": "model.safetensors",
+ "language_model.model.layers.40.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.40.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.40.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.40.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.40.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.40.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.40.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.40.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.40.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.40.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.40.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.40.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.40.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.40.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.40.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.40.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.40.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.40.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.40.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.40.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.40.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.40.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.40.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.40.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.40.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.40.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.40.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.40.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.40.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.40.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.40.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.40.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.40.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.41.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.41.layer_scalar": "model.safetensors",
+ "language_model.model.layers.41.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.41.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.41.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.41.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.41.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.41.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.41.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.41.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.41.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.41.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.41.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.41.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.41.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.41.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.41.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.41.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.41.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.41.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.41.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.41.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.41.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.41.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.41.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.41.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.41.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.41.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.41.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.41.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.41.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.41.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.41.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.41.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.41.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.5.layer_scalar": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.5.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.5.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.5.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.5.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.5.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.5.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.5.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.5.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.5.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.5.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.5.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.5.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.5.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.5.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.5.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.6.layer_scalar": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.6.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.6.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.6.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.6.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.6.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.6.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.6.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.6.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.6.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.6.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.6.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.6.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.6.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.6.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.6.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.layer_scalar": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.7.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.7.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.7.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.7.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.7.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.7.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.7.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.7.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.8.layer_scalar": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.8.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.8.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.8.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.8.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.8.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.8.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.8.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.8.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.8.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.8.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.8.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.8.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.8.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.8.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.8.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.input_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.9.layer_scalar": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.down_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.gate_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.mlp.up_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.per_layer_input_gate.biases": "model.safetensors",
+ "language_model.model.layers.9.per_layer_input_gate.scales": "model.safetensors",
+ "language_model.model.layers.9.per_layer_input_gate.weight": "model.safetensors",
+ "language_model.model.layers.9.per_layer_projection.biases": "model.safetensors",
+ "language_model.model.layers.9.per_layer_projection.scales": "model.safetensors",
+ "language_model.model.layers.9.per_layer_projection.weight": "model.safetensors",
+ "language_model.model.layers.9.post_attention_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.9.post_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.9.post_per_layer_input_norm.weight": "model.safetensors",
+ "language_model.model.layers.9.pre_feedforward_layernorm.weight": "model.safetensors",
+ "language_model.model.layers.9.self_attn.k_norm.weight": "model.safetensors",
+ "language_model.model.layers.9.self_attn.k_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.self_attn.k_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.self_attn.k_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.self_attn.o_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.self_attn.o_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.self_attn.o_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.self_attn.q_norm.weight": "model.safetensors",
+ "language_model.model.layers.9.self_attn.q_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.self_attn.q_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.self_attn.q_proj.weight": "model.safetensors",
+ "language_model.model.layers.9.self_attn.v_proj.biases": "model.safetensors",
+ "language_model.model.layers.9.self_attn.v_proj.scales": "model.safetensors",
+ "language_model.model.layers.9.self_attn.v_proj.weight": "model.safetensors",
+ "language_model.model.norm.weight": "model.safetensors",
+ "language_model.model.per_layer_model_projection.weight": "model.safetensors",
+ "language_model.model.per_layer_projection_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.0.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.1.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.10.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.11.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.12.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.13.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.14.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.15.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.2.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.3.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.4.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.5.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.6.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.7.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.8.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.input_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.down_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.down_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.down_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.down_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.down_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.gate_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.gate_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.gate_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.gate_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.gate_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.up_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.up_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.up_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.up_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.mlp.up_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.post_attention_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.post_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.pre_feedforward_layernorm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.k_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.k_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.k_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.k_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.k_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.k_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.o_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.o_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.o_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.o_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.o_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.q_norm.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.q_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.q_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.q_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.q_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.q_proj.output_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.v_proj.input_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.v_proj.input_min": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.v_proj.linear.weight": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.v_proj.output_max": "model.safetensors",
+ "vision_tower.encoder.layers.9.self_attn.v_proj.output_min": "model.safetensors",
+ "vision_tower.patch_embedder.input_proj.weight": "model.safetensors",
+ "vision_tower.patch_embedder.position_embedding_table": "model.safetensors"
+ }
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/processor_config.json b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/processor_config.json
new file mode 100644
index 0000000..13e92a4
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/processor_config.json
@@ -0,0 +1,42 @@
+{
+ "audio_seq_length": 750,
+ "image_processor": {
+ "do_convert_rgb": true,
+ "do_normalize": false,
+ "do_rescale": true,
+ "do_resize": true,
+ "image_mean": [
+ 0.0,
+ 0.0,
+ 0.0
+ ],
+ "image_processor_type": "Gemma4ImageProcessor",
+ "image_seq_length": 280,
+ "image_std": [
+ 1.0,
+ 1.0,
+ 1.0
+ ],
+ "max_soft_tokens": 280,
+ "patch_size": 16,
+ "pooling_kernel_size": 3,
+ "resample": 3,
+ "rescale_factor": 0.00392156862745098,
+ "size": {
+ "height": 224,
+ "width": 224
+ }
+ },
+ "image_seq_length": 280,
+ "processor_class": "Gemma4Processor",
+ "feature_extractor": {
+ "feature_extractor_type": "Gemma4AudioFeatureExtractor",
+ "sampling_rate": 16000,
+ "num_mel_filters": 128,
+ "fft_length": 512,
+ "hop_length": 160,
+ "chunk_duration": 8.0,
+ "overlap_duration": 1.0
+ },
+ "audio_ms_per_token": 40
+}
\ No newline at end of file
diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/tokenizer.json b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/tokenizer.json
new file mode 100644
index 0000000..1ff9f3e
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:cc8d3a0ce36466ccc1278bf987df5f71db1719b9ca6b4118264f45cb627bfe0f
+size 32169626
diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/tokenizer_config.json b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/tokenizer_config.json
new file mode 100644
index 0000000..375b25d
--- /dev/null
+++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/tokenizer_config.json
@@ -0,0 +1,74 @@
+{
+ "audio_token": "<|audio|>",
+ "backend": "tokenizers",
+ "boa_token": "<|audio>",
+ "boi_token": "<|image>",
+ "bos_token": "",
+ "eoa_token": "",
+ "eoc_token": "",
+ "eoi_token": "",
+ "eos_token": "",
+ "eot_token": "",
+ "escape_token": "<|\"|>",
+ "etc_token": "",
+ "etd_token": "",
+ "etr_token": "",
+ "extra_special_tokens": [
+ "<|video|>"
+ ],
+ "image_token": "<|image|>",
+ "mask_token": "",
+ "model_max_length": 1000000000000000019884624838656,
+ "pad_token": "",
+ "padding_side": "left",
+ "processor_class": "Gemma4Processor",
+ "response_schema": {
+ "type": "object",
+ "properties": {
+ "role": {
+ "const": "assistant"
+ },
+ "thinking": {
+ "type": "string"
+ },
+ "content": {
+ "type": "string"
+ },
+ "tool_calls": {
+ "x-regex-iterator": "<\\|tool_call>(.*?)",
+ "type": "array",
+ "items": {
+ "type": "object",
+ "properties": {
+ "type": {
+ "const": "function"
+ },
+ "function": {
+ "type": "object",
+ "x-regex": "call\\:(?P\\w+)(?P\\{.*\\})",
+ "properties": {
+ "name": {
+ "type": "string"
+ },
+ "arguments": {
+ "type": "object",
+ "x-parser": "gemma4-tool-call",
+ "additionalProperties": {}
+ }
+ }
+ }
+ }
+ }
+ }
+ },
+ "x-regex": "(\\<\\|channel\\>thought\\n(?P.*?)\\)?(?P\\<\\|tool_call\\>.*\\)?(?P(?:(?!\\)(?!\\<\\|tool_response\\>).)+)?(?:\\|\\<\\|tool_response\\>)?"
+ },
+ "soc_token": "<|channel>",
+ "sot_token": "<|turn>",
+ "stc_token": "<|tool_call>",
+ "std_token": "<|tool>",
+ "str_token": "<|tool_response>",
+ "think_token": "<|think|>",
+ "tokenizer_class": "GemmaTokenizer",
+ "unk_token": ""
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/.gitattributes b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/.gitattributes
new file mode 100644
index 0000000..6ae3e2f
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/.gitattributes
@@ -0,0 +1,36 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+text_encoder-hqq-4bit/tokenizer/tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/LICENSE b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/LICENSE
new file mode 100644
index 0000000..66a27ec
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/LICENSE
@@ -0,0 +1,177 @@
+ Apache License
+ Version 2.0, January 2004
+ http://www.apache.org/licenses/
+
+ TERMS AND CONDITIONS FOR USE, REPRODUCTION, AND DISTRIBUTION
+
+ 1. Definitions.
+
+ "License" shall mean the terms and conditions for use, reproduction,
+ and distribution as defined by Sections 1 through 9 of this document.
+
+ "Licensor" shall mean the copyright owner or entity authorized by
+ the copyright owner that is granting the License.
+
+ "Legal Entity" shall mean the union of the acting entity and all
+ other entities that control, are controlled by, or are under common
+ control with that entity. For the purposes of this definition,
+ "control" means (i) the power, direct or indirect, to cause the
+ direction or management of such entity, whether by contract or
+ otherwise, or (ii) ownership of fifty percent (50%) or more of the
+ outstanding shares, or (iii) beneficial ownership of such entity.
+
+ "You" (or "Your") shall mean an individual or Legal Entity
+ exercising permissions granted by this License.
+
+ "Source" form shall mean the preferred form for making modifications,
+ including but not limited to software source code, documentation
+ source, and configuration files.
+
+ "Object" form shall mean any form resulting from mechanical
+ transformation or translation of a Source form, including but
+ not limited to compiled object code, generated documentation,
+ and conversions to other media types.
+
+ "Work" shall mean the work of authorship, whether in Source or
+ Object form, made available under the License, as indicated by a
+ copyright notice that is included in or attached to the work
+ (an example is provided in the Appendix below).
+
+ "Derivative Works" shall mean any work, whether in Source or Object
+ form, that is based on (or derived from) the Work and for which the
+ editorial revisions, annotations, elaborations, or other modifications
+ represent, as a whole, an original work of authorship. For the purposes
+ of this License, Derivative Works shall not include works that remain
+ separable from, or merely link (or bind by name) to the interfaces of,
+ the Work and Derivative Works thereof.
+
+ "Contribution" shall mean any work of authorship, including
+ the original version of the Work and any modifications or additions
+ to that Work or Derivative Works thereof, that is intentionally
+ submitted to Licensor for inclusion in the Work by the copyright owner
+ or by an individual or Legal Entity authorized to submit on behalf of
+ the copyright owner. For the purposes of this definition, "submitted"
+ means any form of electronic, verbal, or written communication sent
+ to the Licensor or its representatives, including but not limited to
+ communication on electronic mailing lists, source code control systems,
+ and issue tracking systems that are managed by, or on behalf of, the
+ Licensor for the purpose of discussing and improving the Work, but
+ excluding communication that is conspicuously marked or otherwise
+ designated in writing by the copyright owner as "Not a Contribution."
+
+ "Contributor" shall mean Licensor and any individual or Legal Entity
+ on behalf of whom a Contribution has been received by Licensor and
+ subsequently incorporated within the Work.
+
+ 2. Grant of Copyright License. Subject to the terms and conditions of
+ this License, each Contributor hereby grants to You a perpetual,
+ worldwide, non-exclusive, no-charge, royalty-free, irrevocable
+ copyright license to reproduce, prepare Derivative Works of,
+ publicly display, publicly perform, sublicense, and distribute the
+ Work and such Derivative Works in Source or Object form.
+
+ 3. Grant of Patent License. Subject to the terms and conditions of
+ this License, each Contributor hereby grants to You a perpetual,
+ worldwide, non-exclusive, no-charge, royalty-free, irrevocable
+ (except as stated in this section) patent license to make, have made,
+ use, offer to sell, sell, import, and otherwise transfer the Work,
+ where such license applies only to those patent claims licensable
+ by such Contributor that are necessarily infringed by their
+ Contribution(s) alone or by combination of their Contribution(s)
+ with the Work to which such Contribution(s) was submitted. If You
+ institute patent litigation against any entity (including a
+ cross-claim or counterclaim in a lawsuit) alleging that the Work
+ or a Contribution incorporated within the Work constitutes direct
+ or contributory patent infringement, then any patent licenses
+ granted to You under this License for that Work shall terminate
+ as of the date such litigation is filed.
+
+ 4. Redistribution. You may reproduce and distribute copies of the
+ Work or Derivative Works thereof in any medium, with or without
+ modifications, and in Source or Object form, provided that You
+ meet the following conditions:
+
+ (a) You must give any other recipients of the Work or
+ Derivative Works a copy of this License; and
+
+ (b) You must cause any modified files to carry prominent notices
+ stating that You changed the files; and
+
+ (c) You must retain, in the Source form of any Derivative Works
+ that You distribute, all copyright, patent, trademark, and
+ attribution notices from the Source form of the Work,
+ excluding those notices that do not pertain to any part of
+ the Derivative Works; and
+
+ (d) If the Work includes a "NOTICE" text file as part of its
+ distribution, then any Derivative Works that You distribute must
+ include a readable copy of the attribution notices contained
+ within such NOTICE file, excluding those notices that do not
+ pertain to any part of the Derivative Works, in at least one
+ of the following places: within a NOTICE text file distributed
+ as part of the Derivative Works; within the Source form or
+ documentation, if provided along with the Derivative Works; or,
+ within a display generated by the Derivative Works, if and
+ wherever such third-party notices normally appear. The contents
+ of the NOTICE file are for informational purposes only and
+ do not modify the License. You may add Your own attribution
+ notices within Derivative Works that You distribute, alongside
+ or as an addendum to the NOTICE text from the Work, provided
+ that such additional attribution notices cannot be construed
+ as modifying the License.
+
+ You may add Your own copyright statement to Your modifications and
+ may provide additional or different license terms and conditions
+ for use, reproduction, or distribution of Your modifications, or
+ for any such Derivative Works as a whole, provided Your use,
+ reproduction, and distribution of the Work otherwise complies with
+ the conditions stated in this License.
+
+ 5. Submission of Contributions. Unless You explicitly state otherwise,
+ any Contribution intentionally submitted for inclusion in the Work
+ by You to the Licensor shall be under the terms and conditions of
+ this License, without any additional terms or conditions.
+ Notwithstanding the above, nothing herein shall supersede or modify
+ the terms of any separate license agreement you may have executed
+ with Licensor regarding such Contributions.
+
+ 6. Trademarks. This License does not grant permission to use the trade
+ names, trademarks, service marks, or product names of the Licensor,
+ except as required for reasonable and customary use in describing the
+ origin of the Work and reproducing the content of the NOTICE file.
+
+ 7. Disclaimer of Warranty. Unless required by applicable law or
+ agreed to in writing, Licensor provides the Work (and each
+ Contributor provides its Contributions) on an "AS IS" BASIS,
+ WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or
+ implied, including, without limitation, any warranties or conditions
+ of TITLE, NON-INFRINGEMENT, MERCHANTABILITY, or FITNESS FOR A
+ PARTICULAR PURPOSE. You are solely responsible for determining the
+ appropriateness of using or redistributing the Work and assume any
+ risks associated with Your exercise of permissions under this License.
+
+ 8. Limitation of Liability. In no event and under no legal theory,
+ whether in tort (including negligence), contract, or otherwise,
+ unless required by applicable law (such as deliberate and grossly
+ negligent acts) or agreed to in writing, shall any Contributor be
+ liable to You for damages, including any direct, indirect, special,
+ incidental, or consequential damages of any character arising as a
+ result of this License or out of the use or inability to use the
+ Work (including but not limited to damages for loss of goodwill,
+ work stoppage, computer failure or malfunction, or any and all
+ other commercial damages or losses), even if such Contributor
+ has been advised of the possibility of such damages.
+
+ 9. Accepting Warranty or Additional Liability. While redistributing
+ the Work or Derivative Works thereof, You may choose to offer,
+ and charge a fee for, acceptance of support, warranty, indemnity,
+ or other liability obligations and/or rights consistent with this
+ License. However, in accepting such obligations, You may act only
+ on Your own behalf and on Your sole responsibility, not on behalf
+ of any other Contributor, and only if You agree to indemnify,
+ defend, and hold each Contributor harmless for any liability
+ incurred by, or claims asserted against, such Contributor by reason
+ of your accepting any such warranty or additional liability.
+
+ END OF TERMS AND CONDITIONS
+
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/NOTICE.md b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/NOTICE.md
new file mode 100644
index 0000000..ef55b08
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/NOTICE.md
@@ -0,0 +1,6 @@
+This software is copyright 2026-present Prism ML, Inc. It is available under the Apache 2.0 license.
+If you publicly deploy or redistribute this software, we would appreciate attribution such as: "Created using Bonsai Image by Prism ML."
+
+This software is built from FLUX.2 [klein] 4B, Copyright 2026 Black Forest Labs, which is available under the Apache 2.0 License: https://huggingface.co/black-forest-labs/FLUX.2-klein-4B/blob/main/LICENSE.md
+
+The text encoder is built from Qwen3-4B, Copyright 2024 Alibaba Cloud, which is available under the Apache 2.0 License: https://huggingface.co/Qwen/Qwen3-4B/blob/main/LICENSE
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/README.md b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/README.md
new file mode 100644
index 0000000..f2582de
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/README.md
@@ -0,0 +1,223 @@
+---
+license: apache-2.0
+pipeline_tag: text-to-image
+tags:
+- 1-bit
+- gemlite
+- hqq
+- cuda
+- text-to-image
+- diffusion
+- flux
+- prismml
+- bonsai
+base_model:
+- prism-ml/bonsai-image-binary-4B-unpacked
+---
+
+
+
+
+
+
+ Prism ML Website |
+ Whitepaper |
+ Demo & Examples |
+ Discord
+
+
+# bonsai-image-binary-4B-gemlite-1bit
+
+Binary weight (1-bit) text-to-image diffusion transformer deployment for NVIDIA GPUs
+
+> **0.93 GB transformer** | **8.3×** smaller than FP16 | **4.5 s / 1024²** on RTX 3080 | **2.7 s / 1024²** on A100 | runs natively on Linux and Windows
+
+## Highlights
+
+- **0.93 GB** diffusion transformer, down from **7.75 GB** for the FP16 FLUX.2 Klein 4B transformer
+- Binary {-1, +1} transformer weights with FP16 group-wise scaling in the matrix-heavy transformer layers (Q/K/V projections, output projections, MLP weights)
+- 4.09 GB CUDA deployment payload including the 4-bit text encoder and FP16 VAE — text encoder is offloaded after prompt encode, so the denoising loop only keeps the compact transformer and VAE resident
+- 4-step FlowMatch-Euler sampler with guidance = 1.0 and shift = 3.0 — no CFG, no negative prompts needed
+- Gemlite low-bit GEMM path for NVIDIA GPUs, with HQQ used for the compressed text encoder
+- Runs on Linux and Windows natively through the same CUDA / Gemlite deployment stack
+- Cross-platform companion: also available as [MLX 1-bit](https://huggingface.co/prism-ml/bonsai-image-binary-4B-mlx-1bit) for Apple Silicon
+
+## Resources
+
+- **[Whitepaper](https://github.com/PrismML-Eng/Bonsai-Image-Demo/blob/main/bonsai-image-4b-whitepaper.pdf)** — full benchmarks, kernels, and memory analysis
+- **[Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo)** — one-command setup for Mac / Linux / Windows
+- **[Discord](https://discord.gg/prismml)** — community + support
+- **Kernels**: [gemlite](https://github.com/mobiusml/gemlite) (fused low-bit GEMM) · [HQQ](https://github.com/mobiusml/hqq) (low-bit quantization runtime) · [triton-windows](https://github.com/triton-lang/triton-windows) (Windows path)
+
+## Model Overview
+
+| Item | Specification |
+| :-------------------- | :----------------------------------------------------------------------------------------------|
+| Base architecture | FLUX.2 Klein 4B (MMDiT diffusion transformer) |
+| Parameters | ~4.0B (transformer trunk) |
+| Blocks | 25 MMDiT blocks: 5 double-stream + 20 single-stream |
+| Sampler | FlowMatchEuler, **4 steps**, guidance = 1.0, shift = 3.0 |
+| Text encoder | Qwen3-4B at 4-bit HQQ (≈ 2.84 GB CUDA payload, offloaded after prompt encode) |
+| VAE | Flux2 32-channel latent, tiled decode (128 px tiles) |
+| Native resolution | 1024×1024 (also supports 512×512 and arbitrary multiples of 32) |
+| Weight format | Gemlite INT1 pack, binary values + FP16 group-wise scales |
+| **Transformer size** | **0.93 GB** model-level Bonsai representation; **1.08 GB** CUDA packed deployment size |
+| Total payload | **4.09 GB** CUDA deployment payload (transformer + 4-bit text encoder + FP16 VAE) |
+| 1-bit coverage | All 100 matmul-heavy linears in the 25 MMDiT blocks |
+| Platforms | Linux x86_64 + Windows native on NVIDIA GPUs |
+| License | Apache 2.0 |
+
+## Binary Weight Representation: 1-bit g128
+
+Each binary weight takes a value from {−1, +1} with one shared FP16 scale per group of 128 weights:
+
+```text
+w_i = scale_g * b_i, b_i in {−1, +1}
+```
+
+Binary values carry exactly 1 bit of information per weight. With one FP16 scale per group of 128, the effective storage is
+
+```text
+b_eff ≈ 1 + 16/128 ≈ 1.125 bits/weight
+```
+
+This gives an idealized **14.2× reduction** relative to FP16 for the binary transformer layers. A small set of precision-sensitive supporting tensors remains in FP16, so the final 1-bit Bonsai Image 4B diffusion transformer is **0.93 GB**, an 8.3x reduction from the 7.75 GB FP16 FLUX.2 Klein 4B transformer.
+
+The binary representation is applied to the matrix-heavy transformer layers, including Q / K / V projections, output projections, MLP linears, and the double-stream add-K / Q / V linears. Supporting tensors (less than 5% of the total parameters) such as modulation streams, embedders, output norm, and output projection remain FP16 for image quality and stability.
+
+The CUDA deployment uses a Gemlite INT1 packed format. The model-level Bonsai representation is **0.93 GB**; the deployed CUDA pack is **1.08 GB** on disk due to runtime packing and alignment overhead in the current Gemlite path.
+
+### Memory
+
+| Format | Transformer size | Reduction | Ratio |
+| :------------------------------ | ---------------: | --------: | -------: |
+| FP16 FLUX.2 Klein 4B | 7.75 GB | — | 1.0× |
+| **1-bit Bonsai Image 4B** | **0.93 GB** | **88.0%** | **8.3×** |
+
+CUDA deployment:
+
+| Component | Size |
+| :------------------------------ | ------: |
+| Gemlite INT1 diffusion transformer | 1.08 GB |
+| HQQ 4-bit text encoder | 2.84 GB |
+| FP16 VAE | 0.17 GB |
+| **Total payload** | **4.09 GB** |
+
+At runtime, the text encoder is offloaded after prompt encoding. During denoising, the repeated image-generation loop is dominated by the compact binary diffusion transformer and active image-generation components rather than the full payload.
+
+Peak HBM at 1024² on RTX 3080 is ~6.4 GiB end-to-end (transformer + VAE + activation memory).
+
+## Best Practices
+
+- Sampler: FlowMatchEuler-discrete with 4 steps, guidance = 1.0, shift = 3.0. The model is designed for 4 steps; running more steps does not improve quality significantly and can introduce artifacts.
+- Resolution: native 1024² is the design target. 512² works for quick previews.
+- Aspect ratios: multiples of 32 are supported, including 832x1248 and 1248x832.
+- Prompting: natural-language prompts. Negative prompts are not required.
+- Runtime memory: the text encoder is offloaded after prompt encoding, so the denoising loop is memory-light.
+
+## Quickstart
+
+### Bonsai Studio (Linux / Windows)
+
+The simplest path is the [Bonsai Image Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo), which sets up the full Bonsai Studio (FastAPI backend + Next.js frontend) and selects gemlite automatically on Linux / Windows:
+
+```bash
+git clone https://github.com/PrismML-Eng/Bonsai-Image-Demo.git
+cd Bonsai-Image-Demo
+./setup.sh
+BONSAI_VARIANT=binary ./scripts/download_model.sh
+BONSAI_VARIANT=binary ./scripts/serve.sh
+```
+
+On Windows (PowerShell):
+
+```powershell
+Set-ExecutionPolicy -Scope CurrentUser RemoteSigned # one-time
+.\setup.ps1
+$env:BONSAI_VARIANT = 'binary'
+.\scripts\download_model.ps1
+.\scripts\serve.ps1
+```
+
+### Python API (backend_gpu)
+
+For inference without the studio frontend:
+
+```python
+from backend_gpu.server import build_pipeline
+
+pipe = build_pipeline(model_id="prism-ml/bonsai-image-binary-4B-gemlite-1bit")
+image = pipe(
+ prompt="A bonsai tree in a quiet ceramic studio, soft morning light",
+ num_inference_steps=4,
+ guidance_scale=1.0,
+ height=1024,
+ width=1024,
+).images[0]
+image.save("bonsai.png")
+```
+
+## Throughput (CUDA / gemlite)
+
+Warmed wall-clock per image, 4 sampler steps, guidance = 1.0, same prompts as the Mac and iPhone measurements. Linux + locally built gemlite kernels except where noted.
+
+| Platform | 512² (s) | 1024² (s) | Notes |
+| :------------------------ | -------: | --------: | :------------------------------------------ |
+| **A100** (Colab) | 1.0 | **2.7** | Ampere datacenter (40 GB) |
+| **RTX PRO 6000 Blackwell** (Colab) | 1.0 | **1.8** | NVIDIA Blackwell, 96 GB VRAM |
+| **RTX 3080** 10 GB | 1.5 | **4.5** | Ampere consumer; 6.4 GiB peak HBM at 1024² |
+| **RTX 3060** 6 GB (laptop)| 4.4 | 24.8 | Ampere mobile; memory-bound at 1024² |
+
+The sub-2-bit pack is what keeps generation viable on commodity GPUs at 1024² — the consumer RTX 3080 reaches 4.5 s/image while the 6 GB laptop 3060 is the slow tail (memory-pressure limited).
+
+## Benchmarks
+
+Evaluated with matched generation settings across the comparison set on H100. GenEval uses the official 512x512 protocol. For HPSv3 and DPG-Bench, larger-backbone rows are evaluated at 1024x1024, while smaller-backbone rows are evaluated at their native 512x512 setting. Higher is better for all three benchmarks.
+
+| Model | Transformer (GB) | GenEval | HPSv3 | DPG-Bench |
+| :-------------------------- | ---------------: | ------: | -----: | --------: |
+| **Bonsai Image · Binary 4B** | **0.93** | **0.671** | **11.15** | **0.822** |
+| **Bonsai Image · Ternary 4B**| **1.21** | **0.723** | **12.22** | **0.851** |
+| FLUX.2 Klein 4B | 7.75 | 0.819 | 12.84 | 0.853 |
+| FLUX.1-schnell | 23.8 | 0.716 | 12.67 | 0.848 |
+| SDXL | 5.14 | 0.300 | 10.05 | 0.740 |
+| PixArt-Σ XL 2 | 1.20 | 0.541 | 11.93 | 0.769 |
+| Stable Diffusion 1.5 | 1.72 | 0.396 | 4.20 | 0.601 |
+| BK-SDM-Small | 0.98 | 0.297 | 3.05 | 0.559 |
+
+The benchmark results show the intended quality-footprint trade-off. 1-bit Bonsai Image 4B is the footprint-oriented variant: it reduces the diffusion transformer below 1 GB while still delivering strong GenEval, HPSv3, and DPG-Bench results. The ternary companion is the quality-oriented variant, using a slightly larger representation to achieve very close visual quality and prompt fidelity to the original FLUX.2 Klein 4B model.
+
+Together, the Bonsai Image variants move the quality-footprint frontier: they bring modern diffusion-transformer behavior into a memory range previously occupied by much smaller, lower-capability models.
+
+## Use Cases
+
+- **Local creative tooling**: image generation directly on CUDA-equipped workstations and consumer GPUs
+- **Private generation**: prompts and generated assets can remain in local or controlled environments
+- **Rapid iteration**: lower local latency and no remote queue for iterative creative workflows
+- **Commodity-GPU serving**: lower transformer footprint and reduced memory pressure for serving on NVIDIA GPUs
+- **Windows and Linux deployment**: native paths through the same Gemlite deployment stack
+- **Enterprise and controlled inference**: local or private environments for data residency and compliance-sensitive workflows
+
+## Limitations
+
+- 1-bit Bonsai Image 4B is not bit-identical to the FP16 FLUX.2 Klein 4B model; it is a compact binary-weight deployment designed to deliver similar practical behavior at much smaller size.
+- Image-generation quality remains prompt- and workflow-dependent. Small text, fine details, object counts, and strict compositional constraints should be evaluated for the target use case.
+- Current commodity inference stacks do not yet expose fully native binary execution as a standard hardware path. This release uses practical Gemlite low-bit GEMM kernels on CUDA.
+- After the diffusion transformer is made compact, other components such as the VAE can become more visible memory bottlenecks. The runtime mitigates this with text-encoder offload and tiled VAE decoding.
+
+
+## Citation
+
+```bibtex
+@techreport{bonsaiimage4b,
+ title = {Bonsai Image 4B: Low-Bit Diffusion on Apple Silicon and Consumer GPUs},
+ author = {Prism ML},
+ year = {2026},
+ month = {May},
+ url = {https://prismml.com}
+}
+```
+
+## Contact
+
+For questions, feedback, or collaboration inquiries: **contact@prismml.com**
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/assets/bonsai-logo.svg b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/assets/bonsai-logo.svg
new file mode 100644
index 0000000..2cfef2b
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/assets/bonsai-logo.svg
@@ -0,0 +1 @@
+
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/manifest.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/manifest.json
new file mode 100644
index 0000000..b63fd5f
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/manifest.json
@@ -0,0 +1,101 @@
+{
+ "model_version": "binary g128 (gemlite-int1 deployment for CUDA inference)",
+ "total_bytes": 4087241554,
+ "files": [
+ {
+ "remote_path": "model_index.json",
+ "size": 81,
+ "sha256": "ecb4735e37691a8733f62957fd6c548f841af40624905bb24fa639756153c8a1"
+ },
+ {
+ "remote_path": "LICENSE",
+ "size": 10174,
+ "sha256": "69849221bfb90053de2134ef5e6d540287b4b98062326492f1f96f5da685524b"
+ },
+ {
+ "remote_path": "NOTICE.md",
+ "size": 623,
+ "sha256": "bbefa4a26b836efc040c1a0f155a425d1d833eae1b2534ffc414b1eada3cd922"
+ },
+ {
+ "remote_path": "README.md",
+ "size": 12848,
+ "sha256": "67bfdf7a92d94e0ee759a54aa472d61a9d6aff79e262a2508d68f5a66056d961"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/config.json",
+ "size": 1535,
+ "sha256": "979b4d6b42dfae3c6dece91da5fe139926dee4a1a244a1cf129d2025c2a60064"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/qmodel.pt",
+ "size": 2822340711,
+ "sha256": "57ecb803e88313f896b24f2f6fedddcb2966c174801f8d89115f4fbae99be48a"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/tokenizer/added_tokens.json",
+ "size": 707,
+ "sha256": "c0284b582e14987fbd3d5a2cb2bd139084371ed9acbae488829a1c900833c680"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/tokenizer/chat_template.jinja",
+ "size": 4168,
+ "sha256": "a55ee1b1660128b7098723e0abcd92caa0788061051c62d51cbe87d9cf1974d8"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/tokenizer/merges.txt",
+ "size": 1671853,
+ "sha256": "8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/tokenizer/special_tokens_map.json",
+ "size": 613,
+ "sha256": "76862e765266b85aa9459767e33cbaf13970f327a0e88d1c65846c2ddd3a1ecd"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/tokenizer/tokenizer.json",
+ "size": 11422654,
+ "sha256": "aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/tokenizer/tokenizer_config.json",
+ "size": 5404,
+ "sha256": "443bfa629eb16387a12edbf92a76f6a6f10b2af3b53d87ba1550adfcf45f7fa0"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/tokenizer/vocab.json",
+ "size": 2776833,
+ "sha256": "ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910"
+ },
+ {
+ "remote_path": "transformer-gemlite-int1/config.json",
+ "size": 620,
+ "sha256": "f4c11e406efb84b36ada1a4287423d4aff2092d74bf15774455f88a7e4888a02"
+ },
+ {
+ "remote_path": "transformer-gemlite-int1/gemlite_autotune.json",
+ "size": 470216,
+ "sha256": "a70e0f3fd1eeaf6836a8be431ee27ae143543cb28349a0298b135e713600288d"
+ },
+ {
+ "remote_path": "transformer-gemlite-int1/quantization_config.json",
+ "size": 6010,
+ "sha256": "8e0bd42f7fdf4af5b513da3c69681a37d881945c644f34b4543788cfa9f6c4f4"
+ },
+ {
+ "remote_path": "transformer-gemlite-int1/state_dict.pt",
+ "size": 1080394762,
+ "sha256": "d5b455b11958fc92ed8dd7558072252d6ca8d1acb4fcc69281fb61b771f7c8e0"
+ },
+ {
+ "remote_path": "vae/config.json",
+ "size": 864,
+ "sha256": "a1cb2ba54a569913eca375d9ee3afe683ba680bd9f64a49d86ec2bd14f304409"
+ },
+ {
+ "remote_path": "vae/diffusion_pytorch_model.safetensors",
+ "size": 168120878,
+ "sha256": "ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04"
+ }
+ ]
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/model_index.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/model_index.json
new file mode 100644
index 0000000..23fc542
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/model_index.json
@@ -0,0 +1,4 @@
+{
+ "_class_name": "Flux2KleinPipeline",
+ "_diffusers_version": "0.37.0.dev0"
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/config.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/config.json
new file mode 100644
index 0000000..161d1cf
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/config.json
@@ -0,0 +1,68 @@
+{
+ "architectures": [
+ "Qwen3ForCausalLM"
+ ],
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "bos_token_id": 151643,
+ "dtype": "float16",
+ "eos_token_id": 151645,
+ "head_dim": 128,
+ "hidden_act": "silu",
+ "hidden_size": 2560,
+ "initializer_range": 0.02,
+ "intermediate_size": 9728,
+ "layer_types": [
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 40960,
+ "max_window_layers": 36,
+ "model_type": "qwen3",
+ "num_attention_heads": 32,
+ "num_hidden_layers": 36,
+ "num_key_value_heads": 8,
+ "rms_norm_eps": 1e-06,
+ "rope_scaling": null,
+ "rope_theta": 1000000,
+ "sliding_window": null,
+ "tie_word_embeddings": true,
+ "transformers_version": "4.57.6",
+ "use_cache": true,
+ "use_sliding_window": false,
+ "vocab_size": 151936
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/qmodel.pt b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/qmodel.pt
new file mode 100644
index 0000000..eb8c85b
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/qmodel.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:57ecb803e88313f896b24f2f6fedddcb2966c174801f8d89115f4fbae99be48a
+size 2822340711
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/added_tokens.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/added_tokens.json
new file mode 100644
index 0000000..b54f913
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/added_tokens.json
@@ -0,0 +1,28 @@
+{
+ " ": 151668,
+ " ": 151658,
+ "": 151666,
+ "": 151667,
+ "": 151657,
+ "": 151665,
+ "<|box_end|>": 151649,
+ "<|box_start|>": 151648,
+ "<|endoftext|>": 151643,
+ "<|file_sep|>": 151664,
+ "<|fim_middle|>": 151660,
+ "<|fim_pad|>": 151662,
+ "<|fim_prefix|>": 151659,
+ "<|fim_suffix|>": 151661,
+ "<|im_end|>": 151645,
+ "<|im_start|>": 151644,
+ "<|image_pad|>": 151655,
+ "<|object_ref_end|>": 151647,
+ "<|object_ref_start|>": 151646,
+ "<|quad_end|>": 151651,
+ "<|quad_start|>": 151650,
+ "<|repo_name|>": 151663,
+ "<|video_pad|>": 151656,
+ "<|vision_end|>": 151653,
+ "<|vision_pad|>": 151654,
+ "<|vision_start|>": 151652
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/chat_template.jinja b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/chat_template.jinja
new file mode 100644
index 0000000..01be9b3
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/chat_template.jinja
@@ -0,0 +1,89 @@
+{%- if tools %}
+ {{- '<|im_start|>system\n' }}
+ {%- if messages[0].role == 'system' %}
+ {{- messages[0].content + '\n\n' }}
+ {%- endif %}
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n \n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n <|im_end|>\n" }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith(' ')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+{%- endfor %}
+{%- for message in messages %}
+ {%- if message.content is string %}
+ {%- set content = message.content %}
+ {%- else %}
+ {%- set content = '' %}
+ {%- endif %}
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if ' ' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split(' ')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {%- if loop.last or (not loop.last and reasoning_content) %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n \n\n' + content.lstrip('\n') }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if (loop.first and content) or (not loop.first) %}
+ {{- '\n' }}
+ {%- endif %}
+ {%- if tool_call.function %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {{- '\n{"name": "' }}
+ {{- tool_call.name }}
+ {{- '", "arguments": ' }}
+ {%- if tool_call.arguments is string %}
+ {{- tool_call.arguments }}
+ {%- else %}
+ {{- tool_call.arguments | tojson }}
+ {%- endif %}
+ {{- '}\n ' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n ' }}
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n \n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/merges.txt b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/merges.txt
new file mode 100644
index 0000000..80c1a19
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/merges.txt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5
+size 1671853
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/special_tokens_map.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/special_tokens_map.json
new file mode 100644
index 0000000..ac23c0a
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/special_tokens_map.json
@@ -0,0 +1,31 @@
+{
+ "additional_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "eos_token": {
+ "content": "<|im_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "pad_token": {
+ "content": "<|endoftext|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ }
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/tokenizer.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/tokenizer.json
new file mode 100644
index 0000000..cd71f61
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4
+size 11422654
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/tokenizer_config.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/tokenizer_config.json
new file mode 100644
index 0000000..ddaf698
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/tokenizer_config.json
@@ -0,0 +1,239 @@
+{
+ "add_bos_token": false,
+ "add_prefix_space": false,
+ "added_tokens_decoder": {
+ "151643": {
+ "content": "<|endoftext|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151644": {
+ "content": "<|im_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151645": {
+ "content": "<|im_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151646": {
+ "content": "<|object_ref_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151647": {
+ "content": "<|object_ref_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151648": {
+ "content": "<|box_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151649": {
+ "content": "<|box_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151650": {
+ "content": "<|quad_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151651": {
+ "content": "<|quad_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151652": {
+ "content": "<|vision_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151653": {
+ "content": "<|vision_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151654": {
+ "content": "<|vision_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151655": {
+ "content": "<|image_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151656": {
+ "content": "<|video_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151657": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151658": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151659": {
+ "content": "<|fim_prefix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151660": {
+ "content": "<|fim_middle|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151661": {
+ "content": "<|fim_suffix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151662": {
+ "content": "<|fim_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151663": {
+ "content": "<|repo_name|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151664": {
+ "content": "<|file_sep|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151665": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151666": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151667": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151668": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ }
+ },
+ "additional_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": {},
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/vocab.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/vocab.json
new file mode 100644
index 0000000..6c49fc6
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/vocab.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910
+size 2776833
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/config.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/config.json
new file mode 100644
index 0000000..2051cb8
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/config.json
@@ -0,0 +1,27 @@
+{
+ "_class_name": "Flux2Transformer2DModel",
+ "_diffusers_version": "0.37.1",
+ "_name_or_path": "black-forest-labs/FLUX.2-klein-4B",
+ "attention_head_dim": 128,
+ "axes_dims_rope": [
+ 32,
+ 32,
+ 32,
+ 32
+ ],
+ "enable_time_sign_embed": false,
+ "eps": 1e-06,
+ "guidance_embeds": false,
+ "in_channels": 128,
+ "joint_attention_dim": 7680,
+ "mlp_ratio": 3.0,
+ "musubi_block_swap_device": "cpu",
+ "musubi_blocks_to_swap": 0,
+ "num_attention_heads": 24,
+ "num_layers": 5,
+ "num_single_layers": 20,
+ "out_channels": null,
+ "patch_size": 1,
+ "rope_theta": 2000,
+ "timestep_guidance_channels": 256
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/gemlite_autotune.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/gemlite_autotune.json
new file mode 100644
index 0000000..ebad19a
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/gemlite_autotune.json
@@ -0,0 +1 @@
+{"GEMV": {}, "GEMV_REVSPLITK": {"(1, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}, "GEMV_SPLITK": {"(1, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 4, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 2, "BLOCK_SIZE_K": 2048, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 4, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 2048, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}, "GEMM_SPLITK": {"(64, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}, "GEMM": {"(4096, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 128, 8, 101)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "NUM_STAGES": 4, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}}
\ No newline at end of file
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/quantization_config.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/quantization_config.json
new file mode 100644
index 0000000..21dec65
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/quantization_config.json
@@ -0,0 +1,162 @@
+{
+ "format": "gemlite-int1-g128",
+ "bits": 1,
+ "group_size": 128,
+ "packing_bitwidth": 8,
+ "input_dtype": "fp16",
+ "output_dtype": "fp16",
+ "skip_patterns": [
+ "proj_out",
+ "x_embedder",
+ "context_embedder",
+ "time_text_embed",
+ "time_guidance_embed",
+ "norm_out",
+ "double_stream_modulation_img",
+ "double_stream_modulation_txt",
+ "single_stream_modulation"
+ ],
+ "quantized_count": 100,
+ "skipped_count": 9,
+ "quantized_fqns": [
+ "transformer_blocks.0.attn.to_q",
+ "transformer_blocks.0.attn.to_k",
+ "transformer_blocks.0.attn.to_v",
+ "transformer_blocks.0.attn.add_q_proj",
+ "transformer_blocks.0.attn.add_k_proj",
+ "transformer_blocks.0.attn.add_v_proj",
+ "transformer_blocks.0.attn.to_add_out",
+ "transformer_blocks.0.attn.to_out.0",
+ "transformer_blocks.0.ff.linear_in",
+ "transformer_blocks.0.ff.linear_out",
+ "transformer_blocks.0.ff_context.linear_in",
+ "transformer_blocks.0.ff_context.linear_out",
+ "transformer_blocks.1.attn.to_q",
+ "transformer_blocks.1.attn.to_k",
+ "transformer_blocks.1.attn.to_v",
+ "transformer_blocks.1.attn.add_q_proj",
+ "transformer_blocks.1.attn.add_k_proj",
+ "transformer_blocks.1.attn.add_v_proj",
+ "transformer_blocks.1.attn.to_add_out",
+ "transformer_blocks.1.attn.to_out.0",
+ "transformer_blocks.1.ff.linear_in",
+ "transformer_blocks.1.ff.linear_out",
+ "transformer_blocks.1.ff_context.linear_in",
+ "transformer_blocks.1.ff_context.linear_out",
+ "transformer_blocks.2.attn.to_q",
+ "transformer_blocks.2.attn.to_k",
+ "transformer_blocks.2.attn.to_v",
+ "transformer_blocks.2.attn.add_q_proj",
+ "transformer_blocks.2.attn.add_k_proj",
+ "transformer_blocks.2.attn.add_v_proj",
+ "transformer_blocks.2.attn.to_add_out",
+ "transformer_blocks.2.attn.to_out.0",
+ "transformer_blocks.2.ff.linear_in",
+ "transformer_blocks.2.ff.linear_out",
+ "transformer_blocks.2.ff_context.linear_in",
+ "transformer_blocks.2.ff_context.linear_out",
+ "transformer_blocks.3.attn.to_q",
+ "transformer_blocks.3.attn.to_k",
+ "transformer_blocks.3.attn.to_v",
+ "transformer_blocks.3.attn.add_q_proj",
+ "transformer_blocks.3.attn.add_k_proj",
+ "transformer_blocks.3.attn.add_v_proj",
+ "transformer_blocks.3.attn.to_add_out",
+ "transformer_blocks.3.attn.to_out.0",
+ "transformer_blocks.3.ff.linear_in",
+ "transformer_blocks.3.ff.linear_out",
+ "transformer_blocks.3.ff_context.linear_in",
+ "transformer_blocks.3.ff_context.linear_out",
+ "transformer_blocks.4.attn.to_q",
+ "transformer_blocks.4.attn.to_k",
+ "transformer_blocks.4.attn.to_v",
+ "transformer_blocks.4.attn.add_q_proj",
+ "transformer_blocks.4.attn.add_k_proj",
+ "transformer_blocks.4.attn.add_v_proj",
+ "transformer_blocks.4.attn.to_add_out",
+ "transformer_blocks.4.attn.to_out.0",
+ "transformer_blocks.4.ff.linear_in",
+ "transformer_blocks.4.ff.linear_out",
+ "transformer_blocks.4.ff_context.linear_in",
+ "transformer_blocks.4.ff_context.linear_out",
+ "single_transformer_blocks.0.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.0.attn.to_out",
+ "single_transformer_blocks.1.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.1.attn.to_out",
+ "single_transformer_blocks.2.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.2.attn.to_out",
+ "single_transformer_blocks.3.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.3.attn.to_out",
+ "single_transformer_blocks.4.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.4.attn.to_out",
+ "single_transformer_blocks.5.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.5.attn.to_out",
+ "single_transformer_blocks.6.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.6.attn.to_out",
+ "single_transformer_blocks.7.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.7.attn.to_out",
+ "single_transformer_blocks.8.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.8.attn.to_out",
+ "single_transformer_blocks.9.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.9.attn.to_out",
+ "single_transformer_blocks.10.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.10.attn.to_out",
+ "single_transformer_blocks.11.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.11.attn.to_out",
+ "single_transformer_blocks.12.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.12.attn.to_out",
+ "single_transformer_blocks.13.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.13.attn.to_out",
+ "single_transformer_blocks.14.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.14.attn.to_out",
+ "single_transformer_blocks.15.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.15.attn.to_out",
+ "single_transformer_blocks.16.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.16.attn.to_out",
+ "single_transformer_blocks.17.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.17.attn.to_out",
+ "single_transformer_blocks.18.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.18.attn.to_out",
+ "single_transformer_blocks.19.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.19.attn.to_out"
+ ],
+ "skipped": [
+ {
+ "fqn": "x_embedder",
+ "reason": "x_embedder"
+ },
+ {
+ "fqn": "context_embedder",
+ "reason": "context_embedder"
+ },
+ {
+ "fqn": "proj_out",
+ "reason": "proj_out"
+ },
+ {
+ "fqn": "time_guidance_embed.timestep_embedder.linear_1",
+ "reason": "time_guidance_embed"
+ },
+ {
+ "fqn": "time_guidance_embed.timestep_embedder.linear_2",
+ "reason": "time_guidance_embed"
+ },
+ {
+ "fqn": "double_stream_modulation_img.linear",
+ "reason": "double_stream_modulation_img"
+ },
+ {
+ "fqn": "double_stream_modulation_txt.linear",
+ "reason": "double_stream_modulation_txt"
+ },
+ {
+ "fqn": "single_stream_modulation.linear",
+ "reason": "single_stream_modulation"
+ },
+ {
+ "fqn": "norm_out.linear",
+ "reason": "norm_out"
+ }
+ ],
+ "pack_seconds": 128.37
+}
\ No newline at end of file
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/state_dict.pt b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/state_dict.pt
new file mode 100644
index 0000000..9161a37
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/state_dict.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:d5b455b11958fc92ed8dd7558072252d6ca8d1acb4fcc69281fb61b771f7c8e0
+size 1080394762
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/vae/config.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/vae/config.json
new file mode 100644
index 0000000..2f6c253
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/vae/config.json
@@ -0,0 +1,41 @@
+{
+ "_class_name": "AutoencoderKLFlux2",
+ "_diffusers_version": "0.37.1",
+ "_name_or_path": "black-forest-labs/FLUX.2-klein-base-4B",
+ "act_fn": "silu",
+ "batch_norm_eps": 0.0001,
+ "batch_norm_momentum": 0.1,
+ "block_out_channels": [
+ 128,
+ 256,
+ 512,
+ 512
+ ],
+ "decoder_block_out_channels": null,
+ "down_block_types": [
+ "DownEncoderBlock2D",
+ "DownEncoderBlock2D",
+ "DownEncoderBlock2D",
+ "DownEncoderBlock2D"
+ ],
+ "force_upcast": true,
+ "in_channels": 3,
+ "latent_channels": 32,
+ "layers_per_block": 2,
+ "mid_block_add_attention": true,
+ "norm_num_groups": 32,
+ "out_channels": 3,
+ "patch_size": [
+ 2,
+ 2
+ ],
+ "sample_size": 1024,
+ "up_block_types": [
+ "UpDecoderBlock2D",
+ "UpDecoderBlock2D",
+ "UpDecoderBlock2D",
+ "UpDecoderBlock2D"
+ ],
+ "use_post_quant_conv": true,
+ "use_quant_conv": true
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/vae/diffusion_pytorch_model.safetensors b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/vae/diffusion_pytorch_model.safetensors
new file mode 100644
index 0000000..0654e17
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/vae/diffusion_pytorch_model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04
+size 168120878
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/.gitattributes b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/.gitattributes
new file mode 100644
index 0000000..6ae3e2f
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/.gitattributes
@@ -0,0 +1,36 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+text_encoder-hqq-4bit/tokenizer/tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/LICENSE b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/LICENSE
new file mode 100644
index 0000000..66a27ec
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/LICENSE
@@ -0,0 +1,177 @@
+ Apache License
+ Version 2.0, January 2004
+ http://www.apache.org/licenses/
+
+ TERMS AND CONDITIONS FOR USE, REPRODUCTION, AND DISTRIBUTION
+
+ 1. Definitions.
+
+ "License" shall mean the terms and conditions for use, reproduction,
+ and distribution as defined by Sections 1 through 9 of this document.
+
+ "Licensor" shall mean the copyright owner or entity authorized by
+ the copyright owner that is granting the License.
+
+ "Legal Entity" shall mean the union of the acting entity and all
+ other entities that control, are controlled by, or are under common
+ control with that entity. For the purposes of this definition,
+ "control" means (i) the power, direct or indirect, to cause the
+ direction or management of such entity, whether by contract or
+ otherwise, or (ii) ownership of fifty percent (50%) or more of the
+ outstanding shares, or (iii) beneficial ownership of such entity.
+
+ "You" (or "Your") shall mean an individual or Legal Entity
+ exercising permissions granted by this License.
+
+ "Source" form shall mean the preferred form for making modifications,
+ including but not limited to software source code, documentation
+ source, and configuration files.
+
+ "Object" form shall mean any form resulting from mechanical
+ transformation or translation of a Source form, including but
+ not limited to compiled object code, generated documentation,
+ and conversions to other media types.
+
+ "Work" shall mean the work of authorship, whether in Source or
+ Object form, made available under the License, as indicated by a
+ copyright notice that is included in or attached to the work
+ (an example is provided in the Appendix below).
+
+ "Derivative Works" shall mean any work, whether in Source or Object
+ form, that is based on (or derived from) the Work and for which the
+ editorial revisions, annotations, elaborations, or other modifications
+ represent, as a whole, an original work of authorship. For the purposes
+ of this License, Derivative Works shall not include works that remain
+ separable from, or merely link (or bind by name) to the interfaces of,
+ the Work and Derivative Works thereof.
+
+ "Contribution" shall mean any work of authorship, including
+ the original version of the Work and any modifications or additions
+ to that Work or Derivative Works thereof, that is intentionally
+ submitted to Licensor for inclusion in the Work by the copyright owner
+ or by an individual or Legal Entity authorized to submit on behalf of
+ the copyright owner. For the purposes of this definition, "submitted"
+ means any form of electronic, verbal, or written communication sent
+ to the Licensor or its representatives, including but not limited to
+ communication on electronic mailing lists, source code control systems,
+ and issue tracking systems that are managed by, or on behalf of, the
+ Licensor for the purpose of discussing and improving the Work, but
+ excluding communication that is conspicuously marked or otherwise
+ designated in writing by the copyright owner as "Not a Contribution."
+
+ "Contributor" shall mean Licensor and any individual or Legal Entity
+ on behalf of whom a Contribution has been received by Licensor and
+ subsequently incorporated within the Work.
+
+ 2. Grant of Copyright License. Subject to the terms and conditions of
+ this License, each Contributor hereby grants to You a perpetual,
+ worldwide, non-exclusive, no-charge, royalty-free, irrevocable
+ copyright license to reproduce, prepare Derivative Works of,
+ publicly display, publicly perform, sublicense, and distribute the
+ Work and such Derivative Works in Source or Object form.
+
+ 3. Grant of Patent License. Subject to the terms and conditions of
+ this License, each Contributor hereby grants to You a perpetual,
+ worldwide, non-exclusive, no-charge, royalty-free, irrevocable
+ (except as stated in this section) patent license to make, have made,
+ use, offer to sell, sell, import, and otherwise transfer the Work,
+ where such license applies only to those patent claims licensable
+ by such Contributor that are necessarily infringed by their
+ Contribution(s) alone or by combination of their Contribution(s)
+ with the Work to which such Contribution(s) was submitted. If You
+ institute patent litigation against any entity (including a
+ cross-claim or counterclaim in a lawsuit) alleging that the Work
+ or a Contribution incorporated within the Work constitutes direct
+ or contributory patent infringement, then any patent licenses
+ granted to You under this License for that Work shall terminate
+ as of the date such litigation is filed.
+
+ 4. Redistribution. You may reproduce and distribute copies of the
+ Work or Derivative Works thereof in any medium, with or without
+ modifications, and in Source or Object form, provided that You
+ meet the following conditions:
+
+ (a) You must give any other recipients of the Work or
+ Derivative Works a copy of this License; and
+
+ (b) You must cause any modified files to carry prominent notices
+ stating that You changed the files; and
+
+ (c) You must retain, in the Source form of any Derivative Works
+ that You distribute, all copyright, patent, trademark, and
+ attribution notices from the Source form of the Work,
+ excluding those notices that do not pertain to any part of
+ the Derivative Works; and
+
+ (d) If the Work includes a "NOTICE" text file as part of its
+ distribution, then any Derivative Works that You distribute must
+ include a readable copy of the attribution notices contained
+ within such NOTICE file, excluding those notices that do not
+ pertain to any part of the Derivative Works, in at least one
+ of the following places: within a NOTICE text file distributed
+ as part of the Derivative Works; within the Source form or
+ documentation, if provided along with the Derivative Works; or,
+ within a display generated by the Derivative Works, if and
+ wherever such third-party notices normally appear. The contents
+ of the NOTICE file are for informational purposes only and
+ do not modify the License. You may add Your own attribution
+ notices within Derivative Works that You distribute, alongside
+ or as an addendum to the NOTICE text from the Work, provided
+ that such additional attribution notices cannot be construed
+ as modifying the License.
+
+ You may add Your own copyright statement to Your modifications and
+ may provide additional or different license terms and conditions
+ for use, reproduction, or distribution of Your modifications, or
+ for any such Derivative Works as a whole, provided Your use,
+ reproduction, and distribution of the Work otherwise complies with
+ the conditions stated in this License.
+
+ 5. Submission of Contributions. Unless You explicitly state otherwise,
+ any Contribution intentionally submitted for inclusion in the Work
+ by You to the Licensor shall be under the terms and conditions of
+ this License, without any additional terms or conditions.
+ Notwithstanding the above, nothing herein shall supersede or modify
+ the terms of any separate license agreement you may have executed
+ with Licensor regarding such Contributions.
+
+ 6. Trademarks. This License does not grant permission to use the trade
+ names, trademarks, service marks, or product names of the Licensor,
+ except as required for reasonable and customary use in describing the
+ origin of the Work and reproducing the content of the NOTICE file.
+
+ 7. Disclaimer of Warranty. Unless required by applicable law or
+ agreed to in writing, Licensor provides the Work (and each
+ Contributor provides its Contributions) on an "AS IS" BASIS,
+ WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or
+ implied, including, without limitation, any warranties or conditions
+ of TITLE, NON-INFRINGEMENT, MERCHANTABILITY, or FITNESS FOR A
+ PARTICULAR PURPOSE. You are solely responsible for determining the
+ appropriateness of using or redistributing the Work and assume any
+ risks associated with Your exercise of permissions under this License.
+
+ 8. Limitation of Liability. In no event and under no legal theory,
+ whether in tort (including negligence), contract, or otherwise,
+ unless required by applicable law (such as deliberate and grossly
+ negligent acts) or agreed to in writing, shall any Contributor be
+ liable to You for damages, including any direct, indirect, special,
+ incidental, or consequential damages of any character arising as a
+ result of this License or out of the use or inability to use the
+ Work (including but not limited to damages for loss of goodwill,
+ work stoppage, computer failure or malfunction, or any and all
+ other commercial damages or losses), even if such Contributor
+ has been advised of the possibility of such damages.
+
+ 9. Accepting Warranty or Additional Liability. While redistributing
+ the Work or Derivative Works thereof, You may choose to offer,
+ and charge a fee for, acceptance of support, warranty, indemnity,
+ or other liability obligations and/or rights consistent with this
+ License. However, in accepting such obligations, You may act only
+ on Your own behalf and on Your sole responsibility, not on behalf
+ of any other Contributor, and only if You agree to indemnify,
+ defend, and hold each Contributor harmless for any liability
+ incurred by, or claims asserted against, such Contributor by reason
+ of your accepting any such warranty or additional liability.
+
+ END OF TERMS AND CONDITIONS
+
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/NOTICE.md b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/NOTICE.md
new file mode 100644
index 0000000..ef55b08
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/NOTICE.md
@@ -0,0 +1,6 @@
+This software is copyright 2026-present Prism ML, Inc. It is available under the Apache 2.0 license.
+If you publicly deploy or redistribute this software, we would appreciate attribution such as: "Created using Bonsai Image by Prism ML."
+
+This software is built from FLUX.2 [klein] 4B, Copyright 2026 Black Forest Labs, which is available under the Apache 2.0 License: https://huggingface.co/black-forest-labs/FLUX.2-klein-4B/blob/main/LICENSE.md
+
+The text encoder is built from Qwen3-4B, Copyright 2024 Alibaba Cloud, which is available under the Apache 2.0 License: https://huggingface.co/Qwen/Qwen3-4B/blob/main/LICENSE
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/README.md b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/README.md
new file mode 100644
index 0000000..1b7c3f1
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/README.md
@@ -0,0 +1,224 @@
+---
+license: apache-2.0
+pipeline_tag: text-to-image
+tags:
+- ternary
+- 1.58-bit
+- gemlite
+- hqq
+- cuda
+- text-to-image
+- diffusion
+- flux
+- prismml
+- bonsai
+base_model:
+- prism-ml/bonsai-image-ternary-4B-unpacked
+---
+
+
+
+
+
+
+ Prism ML Website |
+ White Paper |
+ Demo & Examples |
+ Discord
+
+
+# bonsai-image-ternary-4B-gemlite-2bit
+
+Ternary weight (1.58-bit) text-to-image diffusion transformer deployment for NVIDIA GPUs
+
+> **1.21 GB transformer** | **6.4×** smaller than FP16 | **4.5 s / 1024²** on RTX 3080 | **2.8 s / 1024²** on A100 | runs natively on Linux and Windows
+
+## Highlights
+
+- **1.21 GB** diffusion transformer, down from **7.75 GB** for the FP16 FLUX.2 Klein 4B transformer
+- Ternary {-1, 0, +1} transformer weights with FP16 group-wise scaling in the matrix-heavy transformer layers (Q/K/V projections, output projections, MLP weights)
+- Quality-oriented Bonsai Image variant: the additional zero state improves visual quality and prompt fidelity while keeping the transformer compact
+- 4.55 GB CUDA deployment payload including the 4-bit text encoder and FP16 VAE — text encoder is offloaded after prompt encode, so the denoising loop only keeps the compact transformer and VAE resident
+- 4-step FlowMatch-Euler sampler with guidance = 1.0 and shift = 3.0 — no CFG, no negative prompts needed
+- Gemlite low-bit GEMM path for NVIDIA GPUs, with HQQ used for the compressed text encoder
+- Runs on Linux and Windows natively through the same CUDA / Gemlite deployment stack
+- Cross-platform companion: also available as [MLX 2-bit](https://huggingface.co/prism-ml/bonsai-image-ternary-4B-mlx-2bit) for Apple Silicon
+
+## Resources
+
+- **[White Paper](https://github.com/PrismML-Eng/Bonsai-Image-Demo/blob/main/bonsai-image-4b-whitepaper.pdf)** — full benchmarks, kernels, and memory analysis
+- **[Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo)** — one-command setup for Mac / Linux / Windows
+- **[Discord](https://discord.gg/prismml)** — community + support
+- **Kernels**: [gemlite](https://github.com/mobiusml/gemlite) (fused low-bit GEMM) · [HQQ](https://github.com/mobiusml/hqq) (low-bit quantization runtime) · [triton-windows](https://github.com/triton-lang/triton-windows) (Windows path)
+
+## Model Overview
+
+| Item | Specification |
+| :-------------------- | :----------------------------------------------------------------------------------------------|
+| Base architecture | FLUX.2 Klein 4B (MMDiT diffusion transformer) |
+| Parameters | ~4.0B (transformer trunk) |
+| Blocks | 25 MMDiT blocks: 5 double-stream + 20 single-stream |
+| Sampler | FlowMatchEuler, **4 steps**, guidance = 1.0, shift = 3.0 |
+| Text encoder | Qwen3-4B at 4-bit HQQ (≈ 2.84 GB CUDA payload, offloaded after prompt encode) |
+| VAE | Flux2 32-channel latent, tiled decode (128 px tiles) |
+| Native resolution | 1024×1024 (also supports 512×512 and arbitrary multiples of 32) |
+| Weight format | Gemlite INT2 pack, ternary values + FP16 group-wise scales |
+| **Transformer size** | **1.21 GB** model-level Bonsai representation; **1.54 GB** CUDA packed deployment size |
+| Total payload | **4.55 GB** CUDA deployment payload (transformer + 4-bit text encoder + FP16 VAE) |
+| Ternary coverage | All 100 matmul-heavy linears in the 25 MMDiT blocks |
+| Platforms | Linux x86_64 + Windows native on NVIDIA GPUs |
+| License | Apache 2.0 |
+
+## Ternary Weight Representation: 1.58-bit g128
+
+Each ternary weight takes a value from {−1, 0, +1} with one shared FP16 scale per group of 128 weights:
+
+```text
+w_i = scale_g * t_i, t_i in {−1, 0, +1}
+```
+
+Ternary values carry log₂(3) ≈ 1.585 bits of information per weight. With one FP16 scale per group of 128, the effective storage is:
+
+```text
+b_eff ≈ log2(3) + 16/128 ≈ 1.585 + 0.125 ≈ 1.71 bits/weight
+```
+
+This gives an idealized **9.4× reduction** relative to FP16 for the ternary transformer layers. A small set of precision-sensitive supporting tensors remains in FP16, so the final Ternary Bonsai Image 4B diffusion transformer is **1.21 GB**, a 6.4x reduction from the 7.75 GB FP16 FLUX.2 Klein 4B transformer.
+
+The ternary representation is applied to the matrix-heavy transformer layers, including Q / K / V projections, output projections, MLP linears, and the double-stream add-K / Q / V linears. Supporting tensors (less than 5% of the total parameters) such as modulation streams, embedders, output norm, and output projection remain FP16 for image quality and stability.
+
+The CUDA deployment uses a Gemlite INT2 packed format. Ternary values are stored in 2-bit slots, with the fourth code unused. The model-level Bonsai representation is **1.21 GB**; the deployed CUDA pack is **1.54 GB** on disk due to runtime packing and alignment overhead in the current Gemlite path.
+
+### Memory
+
+| Format | Transformer size | Reduction | Ratio |
+| :------------------------------ | ---------------: | --------: | -------: |
+| FP16 FLUX.2 Klein 4B | 7.75 GB | — | 1.0× |
+| **Ternary Bonsai Image 4B** | **1.21 GB** | **84.4%** | **6.4×** |
+
+CUDA deployment:
+
+| Component | Size |
+| :--------------------------------- | ------: |
+| Gemlite INT2 diffusion transformer | 1.54 GB |
+| HQQ 4-bit text encoder | 2.84 GB |
+| FP16 VAE | 0.17 GB |
+| **Total payload** | **4.55 GB** |
+
+At runtime, the text encoder is offloaded after prompt encoding. During denoising, the repeated image-generation loop is dominated by the compact ternary diffusion transformer and active image-generation components rather than the full payload.
+
+Peak HBM at 1024² on RTX 3080 is ~6.8 GiB end-to-end (transformer + VAE + activation memory).
+
+## Best Practices
+
+- Sampler: FlowMatchEuler-discrete with 4 steps, guidance = 1.0, shift = 3.0. The model is designed for 4 steps; running more steps does not improve quality significantly and can introduce artifacts.
+- Resolution: native 1024² is the design target. 512² works for quick previews.
+- Aspect ratios: multiples of 32 are supported, including 832x1248 and 1248x832.
+- Prompting: natural-language prompts. Negative prompts are not required.
+- Runtime memory: the text encoder is offloaded after prompt encoding, so the denoising loop is memory-light.
+
+## Quickstart
+
+### Bonsai Studio (Linux / Windows)
+
+The simplest path is the [Bonsai Image Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo), which sets up the full Bonsai Studio (FastAPI backend + Next.js frontend) and selects gemlite automatically on Linux / Windows:
+
+```bash
+git clone https://github.com/PrismML-Eng/Bonsai-Image-Demo.git
+cd Bonsai-Image-Demo
+./setup.sh
+./scripts/download_model.sh # ternary is the default
+./scripts/serve.sh
+```
+
+On Windows (PowerShell):
+
+```powershell
+Set-ExecutionPolicy -Scope CurrentUser RemoteSigned # one-time
+.\setup.ps1
+.\scripts\download_model.ps1
+.\scripts\serve.ps1
+```
+
+### Python API (backend_gpu)
+
+For inference without the studio frontend:
+
+```python
+from backend_gpu.server import build_pipeline
+
+pipe = build_pipeline(model_id="prism-ml/bonsai-image-ternary-4B-gemlite-2bit")
+image = pipe(
+ prompt="A bonsai tree in a quiet ceramic studio, soft morning light",
+ num_inference_steps=4,
+ guidance_scale=1.0,
+ height=1024,
+ width=1024,
+).images[0]
+image.save("bonsai.png")
+```
+
+## Throughput (CUDA / gemlite)
+
+Warmed wall-clock per image, 4 denoising steps, guidance = 1.0, matched prompts and sampler settings.
+
+| Platform | 512² (s) | 1024² (s) | Notes |
+| :------------------------ | -------: | --------: | :------------------------------------------ |
+| **A100** (Colab) | 1.1 | **2.8** | Ampere datacenter (40 GB) |
+| **RTX PRO 6000 Blackwell** (Colab) | 1.0 | **2.1** | NVIDIA Blackwell, 96 GB VRAM |
+| **RTX 3080** 10 GB | 1.4 | **4.5** | Ampere consumer; 6.8 GiB peak HBM at 1024² |
+| **RTX 3060** 6 GB (laptop)| 3.3 | 17.5 | Ampere mobile; memory-bound at 1024² |
+
+The sub-2-bit pack keeps generation viable on commodity GPUs at 1024². The RTX 3080 10 GB reaches 4.5 s/image, while the 6 GB laptop RTX 3060 is the memory-constrained tail.
+
+## Benchmarks
+
+Evaluated with matched generation settings across the comparison set on H100. GenEval uses the official 512x512 protocol. For HPSv3 and DPG-Bench, larger-backbone rows are evaluated at 1024x1024, while smaller-backbone rows are evaluated at their native 512x512 setting. Higher is better for all three benchmarks.
+
+| Model | Transformer (GB) | GenEval | HPSv3 | DPG-Bench |
+| :--------------------------- | ---------------: | ------: | -----: | --------: |
+| **Bonsai Image · Ternary 4B**| **1.21** | **0.723** | **12.22** | **0.851** |
+| **Bonsai Image · Binary 4B** | **0.93** | **0.671** | **11.15** | **0.822** |
+| FLUX.2 Klein 4B | 7.75 | 0.819 | 12.84 | 0.853 |
+| FLUX.1-schnell | 23.8 | 0.716 | 12.67 | 0.848 |
+| SDXL | 5.14 | 0.300 | 10.05 | 0.740 |
+| PixArt-Σ XL 2 | 1.20 | 0.541 | 11.93 | 0.769 |
+| Stable Diffusion 1.5 | 1.72 | 0.396 | 4.20 | 0.601 |
+| BK-SDM-Small | 0.98 | 0.297 | 3.05 | 0.559 |
+
+The benchmark results show the intended quality-footprint trade-off. Ternary Bonsai Image 4B is the quality-oriented variant: at 1.21 GB, it sits very close to FLUX.2 Klein 4B across GenEval, HPSv3, and DPG-Bench while reducing the diffusion transformer footprint by 6.4x. The binary companion is the footprint-oriented variant, reducing the diffusion transformer below 1 GB while still delivering strong benchmark results.
+
+Together, the Bonsai Image variants move the quality-footprint frontier: they bring modern diffusion-transformer behavior into a memory range previously occupied by much smaller, lower-capability models.
+
+## Use Cases
+
+- **Local creative tooling**: image generation directly on CUDA-equipped workstations and consumer GPUs
+- **Private generation**: prompts and generated assets can remain in local or controlled environments
+- **Rapid iteration**: lower local latency and no remote queue for iterative creative workflows
+- **Commodity-GPU serving**: lower transformer footprint and reduced memory pressure for serving on NVIDIA GPUs
+- **Windows and Linux deployment**: native paths through the same Gemlite deployment stack
+- **Enterprise and controlled inference**: local or private environments for data residency and compliance-sensitive workflows
+
+## Limitations
+
+- Ternary Bonsai Image 4B is not bit-identical to the FP16 FLUX.2 Klein 4B model; it is a compact ternary-weight deployment designed to deliver similar practical behavior at much smaller size.
+- Image-generation quality remains prompt- and workflow-dependent. Small text, fine details, object counts, and strict compositional constraints should be evaluated for the target use case.
+- Current commodity inference stacks do not yet expose fully native ternary execution as a standard hardware path. This release uses practical Gemlite low-bit GEMM kernels on CUDA.
+- After the diffusion transformer is made compact, other components such as the VAE can become more visible memory bottlenecks. The runtime mitigates this with text-encoder offload and tiled VAE decoding.
+
+
+## Citation
+
+```bibtex
+@techreport{bonsaiimage4b,
+ title = {Bonsai Image 4B: Low-Bit Diffusion on Apple Silicon and Consumer GPUs},
+ author = {Prism ML},
+ year = {2026},
+ month = {May},
+ url = {https://prismml.com}
+}
+```
+
+## Contact
+
+For questions, feedback, or collaboration inquiries: **contact@prismml.com**
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/assets/bonsai-logo.svg b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/assets/bonsai-logo.svg
new file mode 100644
index 0000000..2cfef2b
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/assets/bonsai-logo.svg
@@ -0,0 +1 @@
+
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/manifest.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/manifest.json
new file mode 100644
index 0000000..edf9c99
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/manifest.json
@@ -0,0 +1,101 @@
+{
+ "model_version": "ternary g128 (gemlite-int2 deployment for CUDA inference)",
+ "total_bytes": 4547304490,
+ "files": [
+ {
+ "remote_path": "model_index.json",
+ "size": 81,
+ "sha256": "ecb4735e37691a8733f62957fd6c548f841af40624905bb24fa639756153c8a1"
+ },
+ {
+ "remote_path": "LICENSE",
+ "size": 10174,
+ "sha256": "69849221bfb90053de2134ef5e6d540287b4b98062326492f1f96f5da685524b"
+ },
+ {
+ "remote_path": "NOTICE.md",
+ "size": 623,
+ "sha256": "bbefa4a26b836efc040c1a0f155a425d1d833eae1b2534ffc414b1eada3cd922"
+ },
+ {
+ "remote_path": "README.md",
+ "size": 13033,
+ "sha256": "742dbbcc4ecb979e11f8377bdadfb312a2b1437c5b4950d7a3fb155f71c82f20"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/config.json",
+ "size": 1535,
+ "sha256": "979b4d6b42dfae3c6dece91da5fe139926dee4a1a244a1cf129d2025c2a60064"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/qmodel.pt",
+ "size": 2822340711,
+ "sha256": "57ecb803e88313f896b24f2f6fedddcb2966c174801f8d89115f4fbae99be48a"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/tokenizer/added_tokens.json",
+ "size": 707,
+ "sha256": "c0284b582e14987fbd3d5a2cb2bd139084371ed9acbae488829a1c900833c680"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/tokenizer/chat_template.jinja",
+ "size": 4168,
+ "sha256": "a55ee1b1660128b7098723e0abcd92caa0788061051c62d51cbe87d9cf1974d8"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/tokenizer/merges.txt",
+ "size": 1671853,
+ "sha256": "8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/tokenizer/special_tokens_map.json",
+ "size": 613,
+ "sha256": "76862e765266b85aa9459767e33cbaf13970f327a0e88d1c65846c2ddd3a1ecd"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/tokenizer/tokenizer.json",
+ "size": 11422654,
+ "sha256": "aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/tokenizer/tokenizer_config.json",
+ "size": 5404,
+ "sha256": "443bfa629eb16387a12edbf92a76f6a6f10b2af3b53d87ba1550adfcf45f7fa0"
+ },
+ {
+ "remote_path": "text_encoder-hqq-4bit/tokenizer/vocab.json",
+ "size": 2776833,
+ "sha256": "ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910"
+ },
+ {
+ "remote_path": "transformer-gemlite-int2/config.json",
+ "size": 620,
+ "sha256": "f4c11e406efb84b36ada1a4287423d4aff2092d74bf15774455f88a7e4888a02"
+ },
+ {
+ "remote_path": "transformer-gemlite-int2/gemlite_autotune.json",
+ "size": 470215,
+ "sha256": "6847ecb93765973c0f4c28baee6f265dc66405be3401d1fd5b28496c0aeb0037"
+ },
+ {
+ "remote_path": "transformer-gemlite-int2/quantization_config.json",
+ "size": 6042,
+ "sha256": "889c48a7f55a1630ec97ea5e050fd81df32c8a4a31c44434377a44f449a471fa"
+ },
+ {
+ "remote_path": "transformer-gemlite-int2/state_dict.pt",
+ "size": 1540457482,
+ "sha256": "a3a7df8a90374fea24afce3b36f00b4c728d0254717143d61f912a7b3070e7ac"
+ },
+ {
+ "remote_path": "vae/config.json",
+ "size": 864,
+ "sha256": "a1cb2ba54a569913eca375d9ee3afe683ba680bd9f64a49d86ec2bd14f304409"
+ },
+ {
+ "remote_path": "vae/diffusion_pytorch_model.safetensors",
+ "size": 168120878,
+ "sha256": "ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04"
+ }
+ ]
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/model_index.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/model_index.json
new file mode 100644
index 0000000..23fc542
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/model_index.json
@@ -0,0 +1,4 @@
+{
+ "_class_name": "Flux2KleinPipeline",
+ "_diffusers_version": "0.37.0.dev0"
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/config.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/config.json
new file mode 100644
index 0000000..161d1cf
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/config.json
@@ -0,0 +1,68 @@
+{
+ "architectures": [
+ "Qwen3ForCausalLM"
+ ],
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "bos_token_id": 151643,
+ "dtype": "float16",
+ "eos_token_id": 151645,
+ "head_dim": 128,
+ "hidden_act": "silu",
+ "hidden_size": 2560,
+ "initializer_range": 0.02,
+ "intermediate_size": 9728,
+ "layer_types": [
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention",
+ "full_attention"
+ ],
+ "max_position_embeddings": 40960,
+ "max_window_layers": 36,
+ "model_type": "qwen3",
+ "num_attention_heads": 32,
+ "num_hidden_layers": 36,
+ "num_key_value_heads": 8,
+ "rms_norm_eps": 1e-06,
+ "rope_scaling": null,
+ "rope_theta": 1000000,
+ "sliding_window": null,
+ "tie_word_embeddings": true,
+ "transformers_version": "4.57.6",
+ "use_cache": true,
+ "use_sliding_window": false,
+ "vocab_size": 151936
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/qmodel.pt b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/qmodel.pt
new file mode 100644
index 0000000..eb8c85b
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/qmodel.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:57ecb803e88313f896b24f2f6fedddcb2966c174801f8d89115f4fbae99be48a
+size 2822340711
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/added_tokens.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/added_tokens.json
new file mode 100644
index 0000000..b54f913
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/added_tokens.json
@@ -0,0 +1,28 @@
+{
+ "": 151668,
+ " ": 151658,
+ "": 151666,
+ "": 151667,
+ "": 151657,
+ "": 151665,
+ "<|box_end|>": 151649,
+ "<|box_start|>": 151648,
+ "<|endoftext|>": 151643,
+ "<|file_sep|>": 151664,
+ "<|fim_middle|>": 151660,
+ "<|fim_pad|>": 151662,
+ "<|fim_prefix|>": 151659,
+ "<|fim_suffix|>": 151661,
+ "<|im_end|>": 151645,
+ "<|im_start|>": 151644,
+ "<|image_pad|>": 151655,
+ "<|object_ref_end|>": 151647,
+ "<|object_ref_start|>": 151646,
+ "<|quad_end|>": 151651,
+ "<|quad_start|>": 151650,
+ "<|repo_name|>": 151663,
+ "<|video_pad|>": 151656,
+ "<|vision_end|>": 151653,
+ "<|vision_pad|>": 151654,
+ "<|vision_start|>": 151652
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/chat_template.jinja b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/chat_template.jinja
new file mode 100644
index 0000000..01be9b3
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/chat_template.jinja
@@ -0,0 +1,89 @@
+{%- if tools %}
+ {{- '<|im_start|>system\n' }}
+ {%- if messages[0].role == 'system' %}
+ {{- messages[0].content + '\n\n' }}
+ {%- endif %}
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n \n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n <|im_end|>\n" }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith(' ')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+{%- endfor %}
+{%- for message in messages %}
+ {%- if message.content is string %}
+ {%- set content = message.content %}
+ {%- else %}
+ {%- set content = '' %}
+ {%- endif %}
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if ' ' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split(' ')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {%- if loop.last or (not loop.last and reasoning_content) %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n \n\n' + content.lstrip('\n') }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if (loop.first and content) or (not loop.first) %}
+ {{- '\n' }}
+ {%- endif %}
+ {%- if tool_call.function %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {{- '\n{"name": "' }}
+ {{- tool_call.name }}
+ {{- '", "arguments": ' }}
+ {%- if tool_call.arguments is string %}
+ {{- tool_call.arguments }}
+ {%- else %}
+ {{- tool_call.arguments | tojson }}
+ {%- endif %}
+ {{- '}\n ' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n ' }}
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n \n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/merges.txt b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/merges.txt
new file mode 100644
index 0000000..80c1a19
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/merges.txt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5
+size 1671853
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/special_tokens_map.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/special_tokens_map.json
new file mode 100644
index 0000000..ac23c0a
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/special_tokens_map.json
@@ -0,0 +1,31 @@
+{
+ "additional_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "eos_token": {
+ "content": "<|im_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "pad_token": {
+ "content": "<|endoftext|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ }
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/tokenizer.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/tokenizer.json
new file mode 100644
index 0000000..cd71f61
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4
+size 11422654
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/tokenizer_config.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/tokenizer_config.json
new file mode 100644
index 0000000..ddaf698
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/tokenizer_config.json
@@ -0,0 +1,239 @@
+{
+ "add_bos_token": false,
+ "add_prefix_space": false,
+ "added_tokens_decoder": {
+ "151643": {
+ "content": "<|endoftext|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151644": {
+ "content": "<|im_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151645": {
+ "content": "<|im_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151646": {
+ "content": "<|object_ref_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151647": {
+ "content": "<|object_ref_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151648": {
+ "content": "<|box_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151649": {
+ "content": "<|box_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151650": {
+ "content": "<|quad_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151651": {
+ "content": "<|quad_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151652": {
+ "content": "<|vision_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151653": {
+ "content": "<|vision_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151654": {
+ "content": "<|vision_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151655": {
+ "content": "<|image_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151656": {
+ "content": "<|video_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151657": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151658": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151659": {
+ "content": "<|fim_prefix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151660": {
+ "content": "<|fim_middle|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151661": {
+ "content": "<|fim_suffix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151662": {
+ "content": "<|fim_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151663": {
+ "content": "<|repo_name|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151664": {
+ "content": "<|file_sep|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151665": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151666": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151667": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151668": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ }
+ },
+ "additional_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": {},
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/vocab.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/vocab.json
new file mode 100644
index 0000000..6c49fc6
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/vocab.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910
+size 2776833
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/config.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/config.json
new file mode 100644
index 0000000..2051cb8
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/config.json
@@ -0,0 +1,27 @@
+{
+ "_class_name": "Flux2Transformer2DModel",
+ "_diffusers_version": "0.37.1",
+ "_name_or_path": "black-forest-labs/FLUX.2-klein-4B",
+ "attention_head_dim": 128,
+ "axes_dims_rope": [
+ 32,
+ 32,
+ 32,
+ 32
+ ],
+ "enable_time_sign_embed": false,
+ "eps": 1e-06,
+ "guidance_embeds": false,
+ "in_channels": 128,
+ "joint_attention_dim": 7680,
+ "mlp_ratio": 3.0,
+ "musubi_block_swap_device": "cpu",
+ "musubi_blocks_to_swap": 0,
+ "num_attention_heads": 24,
+ "num_layers": 5,
+ "num_single_layers": 20,
+ "out_channels": null,
+ "patch_size": 1,
+ "rope_theta": 2000,
+ "timestep_guidance_channels": 256
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/gemlite_autotune.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/gemlite_autotune.json
new file mode 100644
index 0000000..86da694
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/gemlite_autotune.json
@@ -0,0 +1 @@
+{"GEMV": {}, "GEMV_REVSPLITK": {"(1, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}, "GEMV_SPLITK": {"(1, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 4, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 2, "BLOCK_SIZE_K": 2048, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 4, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 2048, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}, "GEMM_SPLITK": {"(64, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}, "GEMM": {"(4096, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 128, 4, 102)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "NUM_STAGES": 4, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}}
\ No newline at end of file
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/quantization_config.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/quantization_config.json
new file mode 100644
index 0000000..c93579e
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/quantization_config.json
@@ -0,0 +1,163 @@
+{
+ "format": "gemlite-int2-ternary-g128",
+ "bits": 2,
+ "group_size": 128,
+ "packing_bitwidth": 8,
+ "solver": "ternary",
+ "input_dtype": "fp16",
+ "output_dtype": "fp16",
+ "skip_patterns": [
+ "proj_out",
+ "x_embedder",
+ "context_embedder",
+ "time_text_embed",
+ "time_guidance_embed",
+ "norm_out",
+ "double_stream_modulation_img",
+ "double_stream_modulation_txt",
+ "single_stream_modulation"
+ ],
+ "quantized_count": 100,
+ "skipped_count": 9,
+ "quantized_fqns": [
+ "transformer_blocks.0.attn.to_q",
+ "transformer_blocks.0.attn.to_k",
+ "transformer_blocks.0.attn.to_v",
+ "transformer_blocks.0.attn.add_q_proj",
+ "transformer_blocks.0.attn.add_k_proj",
+ "transformer_blocks.0.attn.add_v_proj",
+ "transformer_blocks.0.attn.to_add_out",
+ "transformer_blocks.0.attn.to_out.0",
+ "transformer_blocks.0.ff.linear_in",
+ "transformer_blocks.0.ff.linear_out",
+ "transformer_blocks.0.ff_context.linear_in",
+ "transformer_blocks.0.ff_context.linear_out",
+ "transformer_blocks.1.attn.to_q",
+ "transformer_blocks.1.attn.to_k",
+ "transformer_blocks.1.attn.to_v",
+ "transformer_blocks.1.attn.add_q_proj",
+ "transformer_blocks.1.attn.add_k_proj",
+ "transformer_blocks.1.attn.add_v_proj",
+ "transformer_blocks.1.attn.to_add_out",
+ "transformer_blocks.1.attn.to_out.0",
+ "transformer_blocks.1.ff.linear_in",
+ "transformer_blocks.1.ff.linear_out",
+ "transformer_blocks.1.ff_context.linear_in",
+ "transformer_blocks.1.ff_context.linear_out",
+ "transformer_blocks.2.attn.to_q",
+ "transformer_blocks.2.attn.to_k",
+ "transformer_blocks.2.attn.to_v",
+ "transformer_blocks.2.attn.add_q_proj",
+ "transformer_blocks.2.attn.add_k_proj",
+ "transformer_blocks.2.attn.add_v_proj",
+ "transformer_blocks.2.attn.to_add_out",
+ "transformer_blocks.2.attn.to_out.0",
+ "transformer_blocks.2.ff.linear_in",
+ "transformer_blocks.2.ff.linear_out",
+ "transformer_blocks.2.ff_context.linear_in",
+ "transformer_blocks.2.ff_context.linear_out",
+ "transformer_blocks.3.attn.to_q",
+ "transformer_blocks.3.attn.to_k",
+ "transformer_blocks.3.attn.to_v",
+ "transformer_blocks.3.attn.add_q_proj",
+ "transformer_blocks.3.attn.add_k_proj",
+ "transformer_blocks.3.attn.add_v_proj",
+ "transformer_blocks.3.attn.to_add_out",
+ "transformer_blocks.3.attn.to_out.0",
+ "transformer_blocks.3.ff.linear_in",
+ "transformer_blocks.3.ff.linear_out",
+ "transformer_blocks.3.ff_context.linear_in",
+ "transformer_blocks.3.ff_context.linear_out",
+ "transformer_blocks.4.attn.to_q",
+ "transformer_blocks.4.attn.to_k",
+ "transformer_blocks.4.attn.to_v",
+ "transformer_blocks.4.attn.add_q_proj",
+ "transformer_blocks.4.attn.add_k_proj",
+ "transformer_blocks.4.attn.add_v_proj",
+ "transformer_blocks.4.attn.to_add_out",
+ "transformer_blocks.4.attn.to_out.0",
+ "transformer_blocks.4.ff.linear_in",
+ "transformer_blocks.4.ff.linear_out",
+ "transformer_blocks.4.ff_context.linear_in",
+ "transformer_blocks.4.ff_context.linear_out",
+ "single_transformer_blocks.0.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.0.attn.to_out",
+ "single_transformer_blocks.1.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.1.attn.to_out",
+ "single_transformer_blocks.2.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.2.attn.to_out",
+ "single_transformer_blocks.3.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.3.attn.to_out",
+ "single_transformer_blocks.4.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.4.attn.to_out",
+ "single_transformer_blocks.5.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.5.attn.to_out",
+ "single_transformer_blocks.6.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.6.attn.to_out",
+ "single_transformer_blocks.7.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.7.attn.to_out",
+ "single_transformer_blocks.8.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.8.attn.to_out",
+ "single_transformer_blocks.9.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.9.attn.to_out",
+ "single_transformer_blocks.10.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.10.attn.to_out",
+ "single_transformer_blocks.11.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.11.attn.to_out",
+ "single_transformer_blocks.12.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.12.attn.to_out",
+ "single_transformer_blocks.13.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.13.attn.to_out",
+ "single_transformer_blocks.14.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.14.attn.to_out",
+ "single_transformer_blocks.15.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.15.attn.to_out",
+ "single_transformer_blocks.16.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.16.attn.to_out",
+ "single_transformer_blocks.17.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.17.attn.to_out",
+ "single_transformer_blocks.18.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.18.attn.to_out",
+ "single_transformer_blocks.19.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.19.attn.to_out"
+ ],
+ "skipped": [
+ {
+ "fqn": "x_embedder",
+ "reason": "x_embedder"
+ },
+ {
+ "fqn": "context_embedder",
+ "reason": "context_embedder"
+ },
+ {
+ "fqn": "proj_out",
+ "reason": "proj_out"
+ },
+ {
+ "fqn": "time_guidance_embed.timestep_embedder.linear_1",
+ "reason": "time_guidance_embed"
+ },
+ {
+ "fqn": "time_guidance_embed.timestep_embedder.linear_2",
+ "reason": "time_guidance_embed"
+ },
+ {
+ "fqn": "double_stream_modulation_img.linear",
+ "reason": "double_stream_modulation_img"
+ },
+ {
+ "fqn": "double_stream_modulation_txt.linear",
+ "reason": "double_stream_modulation_txt"
+ },
+ {
+ "fqn": "single_stream_modulation.linear",
+ "reason": "single_stream_modulation"
+ },
+ {
+ "fqn": "norm_out.linear",
+ "reason": "norm_out"
+ }
+ ],
+ "pack_seconds": 150.48
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/state_dict.pt b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/state_dict.pt
new file mode 100644
index 0000000..b4d1f2b
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/state_dict.pt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:a3a7df8a90374fea24afce3b36f00b4c728d0254717143d61f912a7b3070e7ac
+size 1540457482
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/vae/config.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/vae/config.json
new file mode 100644
index 0000000..2f6c253
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/vae/config.json
@@ -0,0 +1,41 @@
+{
+ "_class_name": "AutoencoderKLFlux2",
+ "_diffusers_version": "0.37.1",
+ "_name_or_path": "black-forest-labs/FLUX.2-klein-base-4B",
+ "act_fn": "silu",
+ "batch_norm_eps": 0.0001,
+ "batch_norm_momentum": 0.1,
+ "block_out_channels": [
+ 128,
+ 256,
+ 512,
+ 512
+ ],
+ "decoder_block_out_channels": null,
+ "down_block_types": [
+ "DownEncoderBlock2D",
+ "DownEncoderBlock2D",
+ "DownEncoderBlock2D",
+ "DownEncoderBlock2D"
+ ],
+ "force_upcast": true,
+ "in_channels": 3,
+ "latent_channels": 32,
+ "layers_per_block": 2,
+ "mid_block_add_attention": true,
+ "norm_num_groups": 32,
+ "out_channels": 3,
+ "patch_size": [
+ 2,
+ 2
+ ],
+ "sample_size": 1024,
+ "up_block_types": [
+ "UpDecoderBlock2D",
+ "UpDecoderBlock2D",
+ "UpDecoderBlock2D",
+ "UpDecoderBlock2D"
+ ],
+ "use_post_quant_conv": true,
+ "use_quant_conv": true
+}
diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/vae/diffusion_pytorch_model.safetensors b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/vae/diffusion_pytorch_model.safetensors
new file mode 100644
index 0000000..0654e17
--- /dev/null
+++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/vae/diffusion_pytorch_model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04
+size 168120878
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/.gitattributes b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/.gitattributes
new file mode 100644
index 0000000..74614b5
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/.gitattributes
@@ -0,0 +1,37 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+text_encoder-mlx-4bit/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+tokenizer/tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/LICENSE b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/LICENSE
new file mode 100644
index 0000000..66a27ec
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/LICENSE
@@ -0,0 +1,177 @@
+ Apache License
+ Version 2.0, January 2004
+ http://www.apache.org/licenses/
+
+ TERMS AND CONDITIONS FOR USE, REPRODUCTION, AND DISTRIBUTION
+
+ 1. Definitions.
+
+ "License" shall mean the terms and conditions for use, reproduction,
+ and distribution as defined by Sections 1 through 9 of this document.
+
+ "Licensor" shall mean the copyright owner or entity authorized by
+ the copyright owner that is granting the License.
+
+ "Legal Entity" shall mean the union of the acting entity and all
+ other entities that control, are controlled by, or are under common
+ control with that entity. For the purposes of this definition,
+ "control" means (i) the power, direct or indirect, to cause the
+ direction or management of such entity, whether by contract or
+ otherwise, or (ii) ownership of fifty percent (50%) or more of the
+ outstanding shares, or (iii) beneficial ownership of such entity.
+
+ "You" (or "Your") shall mean an individual or Legal Entity
+ exercising permissions granted by this License.
+
+ "Source" form shall mean the preferred form for making modifications,
+ including but not limited to software source code, documentation
+ source, and configuration files.
+
+ "Object" form shall mean any form resulting from mechanical
+ transformation or translation of a Source form, including but
+ not limited to compiled object code, generated documentation,
+ and conversions to other media types.
+
+ "Work" shall mean the work of authorship, whether in Source or
+ Object form, made available under the License, as indicated by a
+ copyright notice that is included in or attached to the work
+ (an example is provided in the Appendix below).
+
+ "Derivative Works" shall mean any work, whether in Source or Object
+ form, that is based on (or derived from) the Work and for which the
+ editorial revisions, annotations, elaborations, or other modifications
+ represent, as a whole, an original work of authorship. For the purposes
+ of this License, Derivative Works shall not include works that remain
+ separable from, or merely link (or bind by name) to the interfaces of,
+ the Work and Derivative Works thereof.
+
+ "Contribution" shall mean any work of authorship, including
+ the original version of the Work and any modifications or additions
+ to that Work or Derivative Works thereof, that is intentionally
+ submitted to Licensor for inclusion in the Work by the copyright owner
+ or by an individual or Legal Entity authorized to submit on behalf of
+ the copyright owner. For the purposes of this definition, "submitted"
+ means any form of electronic, verbal, or written communication sent
+ to the Licensor or its representatives, including but not limited to
+ communication on electronic mailing lists, source code control systems,
+ and issue tracking systems that are managed by, or on behalf of, the
+ Licensor for the purpose of discussing and improving the Work, but
+ excluding communication that is conspicuously marked or otherwise
+ designated in writing by the copyright owner as "Not a Contribution."
+
+ "Contributor" shall mean Licensor and any individual or Legal Entity
+ on behalf of whom a Contribution has been received by Licensor and
+ subsequently incorporated within the Work.
+
+ 2. Grant of Copyright License. Subject to the terms and conditions of
+ this License, each Contributor hereby grants to You a perpetual,
+ worldwide, non-exclusive, no-charge, royalty-free, irrevocable
+ copyright license to reproduce, prepare Derivative Works of,
+ publicly display, publicly perform, sublicense, and distribute the
+ Work and such Derivative Works in Source or Object form.
+
+ 3. Grant of Patent License. Subject to the terms and conditions of
+ this License, each Contributor hereby grants to You a perpetual,
+ worldwide, non-exclusive, no-charge, royalty-free, irrevocable
+ (except as stated in this section) patent license to make, have made,
+ use, offer to sell, sell, import, and otherwise transfer the Work,
+ where such license applies only to those patent claims licensable
+ by such Contributor that are necessarily infringed by their
+ Contribution(s) alone or by combination of their Contribution(s)
+ with the Work to which such Contribution(s) was submitted. If You
+ institute patent litigation against any entity (including a
+ cross-claim or counterclaim in a lawsuit) alleging that the Work
+ or a Contribution incorporated within the Work constitutes direct
+ or contributory patent infringement, then any patent licenses
+ granted to You under this License for that Work shall terminate
+ as of the date such litigation is filed.
+
+ 4. Redistribution. You may reproduce and distribute copies of the
+ Work or Derivative Works thereof in any medium, with or without
+ modifications, and in Source or Object form, provided that You
+ meet the following conditions:
+
+ (a) You must give any other recipients of the Work or
+ Derivative Works a copy of this License; and
+
+ (b) You must cause any modified files to carry prominent notices
+ stating that You changed the files; and
+
+ (c) You must retain, in the Source form of any Derivative Works
+ that You distribute, all copyright, patent, trademark, and
+ attribution notices from the Source form of the Work,
+ excluding those notices that do not pertain to any part of
+ the Derivative Works; and
+
+ (d) If the Work includes a "NOTICE" text file as part of its
+ distribution, then any Derivative Works that You distribute must
+ include a readable copy of the attribution notices contained
+ within such NOTICE file, excluding those notices that do not
+ pertain to any part of the Derivative Works, in at least one
+ of the following places: within a NOTICE text file distributed
+ as part of the Derivative Works; within the Source form or
+ documentation, if provided along with the Derivative Works; or,
+ within a display generated by the Derivative Works, if and
+ wherever such third-party notices normally appear. The contents
+ of the NOTICE file are for informational purposes only and
+ do not modify the License. You may add Your own attribution
+ notices within Derivative Works that You distribute, alongside
+ or as an addendum to the NOTICE text from the Work, provided
+ that such additional attribution notices cannot be construed
+ as modifying the License.
+
+ You may add Your own copyright statement to Your modifications and
+ may provide additional or different license terms and conditions
+ for use, reproduction, or distribution of Your modifications, or
+ for any such Derivative Works as a whole, provided Your use,
+ reproduction, and distribution of the Work otherwise complies with
+ the conditions stated in this License.
+
+ 5. Submission of Contributions. Unless You explicitly state otherwise,
+ any Contribution intentionally submitted for inclusion in the Work
+ by You to the Licensor shall be under the terms and conditions of
+ this License, without any additional terms or conditions.
+ Notwithstanding the above, nothing herein shall supersede or modify
+ the terms of any separate license agreement you may have executed
+ with Licensor regarding such Contributions.
+
+ 6. Trademarks. This License does not grant permission to use the trade
+ names, trademarks, service marks, or product names of the Licensor,
+ except as required for reasonable and customary use in describing the
+ origin of the Work and reproducing the content of the NOTICE file.
+
+ 7. Disclaimer of Warranty. Unless required by applicable law or
+ agreed to in writing, Licensor provides the Work (and each
+ Contributor provides its Contributions) on an "AS IS" BASIS,
+ WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or
+ implied, including, without limitation, any warranties or conditions
+ of TITLE, NON-INFRINGEMENT, MERCHANTABILITY, or FITNESS FOR A
+ PARTICULAR PURPOSE. You are solely responsible for determining the
+ appropriateness of using or redistributing the Work and assume any
+ risks associated with Your exercise of permissions under this License.
+
+ 8. Limitation of Liability. In no event and under no legal theory,
+ whether in tort (including negligence), contract, or otherwise,
+ unless required by applicable law (such as deliberate and grossly
+ negligent acts) or agreed to in writing, shall any Contributor be
+ liable to You for damages, including any direct, indirect, special,
+ incidental, or consequential damages of any character arising as a
+ result of this License or out of the use or inability to use the
+ Work (including but not limited to damages for loss of goodwill,
+ work stoppage, computer failure or malfunction, or any and all
+ other commercial damages or losses), even if such Contributor
+ has been advised of the possibility of such damages.
+
+ 9. Accepting Warranty or Additional Liability. While redistributing
+ the Work or Derivative Works thereof, You may choose to offer,
+ and charge a fee for, acceptance of support, warranty, indemnity,
+ or other liability obligations and/or rights consistent with this
+ License. However, in accepting such obligations, You may act only
+ on Your own behalf and on Your sole responsibility, not on behalf
+ of any other Contributor, and only if You agree to indemnify,
+ defend, and hold each Contributor harmless for any liability
+ incurred by, or claims asserted against, such Contributor by reason
+ of your accepting any such warranty or additional liability.
+
+ END OF TERMS AND CONDITIONS
+
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/NOTICE.md b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/NOTICE.md
new file mode 100644
index 0000000..ef55b08
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/NOTICE.md
@@ -0,0 +1,6 @@
+This software is copyright 2026-present Prism ML, Inc. It is available under the Apache 2.0 license.
+If you publicly deploy or redistribute this software, we would appreciate attribution such as: "Created using Bonsai Image by Prism ML."
+
+This software is built from FLUX.2 [klein] 4B, Copyright 2026 Black Forest Labs, which is available under the Apache 2.0 License: https://huggingface.co/black-forest-labs/FLUX.2-klein-4B/blob/main/LICENSE.md
+
+The text encoder is built from Qwen3-4B, Copyright 2024 Alibaba Cloud, which is available under the Apache 2.0 License: https://huggingface.co/Qwen/Qwen3-4B/blob/main/LICENSE
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/README.md b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/README.md
new file mode 100644
index 0000000..98dad38
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/README.md
@@ -0,0 +1,207 @@
+---
+license: apache-2.0
+pipeline_tag: text-to-image
+tags:
+- 1-bit
+- mlx
+- apple-silicon
+- on-device
+- text-to-image
+- diffusion
+- flux
+- prismml
+- bonsai
+base_model:
+- prism-ml/bonsai-image-binary-4B-unpacked
+---
+
+
+
+
+
+
+ Prism ML Website |
+ Whitepaper |
+ Demo & Examples |
+ Discord
+
+
+# bonsai-image-binary-4B-mlx-1bit
+
+Binary weight (1-bit) text-to-image diffusion transformer deployment for Apple Silicon
+
+> **0.93 GB transformer** | **8.3×** smaller than FP16 | **9.4 s / 512²** on iPhone 17 Pro Max | **6 s / 512²** on M4 Pro | runs on Mac, iPhone, iPad
+
+## Highlights
+
+- **0.93 GB** diffusion transformer, down from **7.75 GB** for the FP16 FLUX.2 Klein 4B transformer
+- Binary {−1, +1} transformer weights with FP16 group-wise scaling in the matrix-heavy transformer layers (Q/K/V projections, output projections, MLP weights)
+- 3.42 GB Apple Silicon deployment payload including the 4-bit text encoder and FP16 VAE — text encoder is offloaded after prompt encode, so the denoising loop only keeps the compact transformer and VAE resident
+- 4-step FlowMatch-Euler sampler with guidance = 1.0 and shift = 3.0 — no CFG, no negative prompts needed
+- MLX-native 1-bit format for Apple Silicon, the same kernel path as our 1-bit language-model releases
+- Cross-platform companion: also available as [gemlite 1-bit](https://huggingface.co/prism-ml/bonsai-image-binary-4B-gemlite-1bit) for NVIDIA GPUs
+
+## Resources
+
+- **[Whitepaper](https://github.com/PrismML-Eng/Bonsai-Image-Demo/blob/main/bonsai-image-4b-whitepaper.pdf)** — full benchmarks, kernels, and memory analysis
+- **[Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo)** — one-command setup for Mac / Linux / Windows
+- **[Discord](https://discord.gg/prismml)** — community + support
+- **Kernels**: [MLX fork](https://github.com/PrismML-Eng/mlx) (Apple Silicon) · [mlx-swift fork](https://github.com/PrismML-Eng/mlx-swift) (iOS / macOS) — upstream PRs pending
+
+## Model Overview
+
+| Item | Specification |
+| :-------------------- | :-------------------------------------------------------------------------------------|
+| Base architecture | FLUX.2 Klein 4B (MMDiT diffusion transformer) |
+| Parameters | ~4.0B (transformer trunk) |
+| Blocks | 25 MMDiT blocks: 5 double-stream + 20 single-stream |
+| Sampler | FlowMatchEuler, **4 steps**, guidance = 1.0, shift = 3.0 |
+| Text encoder | Qwen3-4B at 4-bit (≈ 2.28 GB on-device, offloaded after prompt encode) |
+| VAE | Flux2 32-channel latent, tiled decode (128 px tiles) |
+| Native resolution | 1024×1024 (also supports 512×512 and arbitrary multiples of 32) |
+| Weight format | MLX 1-bit g128, binary values + FP16 group-wise scales |
+| **Transformer size** | **0.93 GB** (8.3× smaller than 7.75 GB FP16) |
+| Total payload | **3.42 GB** (4.7x smaller than the 15.97 GB FP16 transformer + text encoder + VAE) |
+| 1-bit coverage | All 100 matmul-heavy linears in the 25 MMDiT blocks |
+| License | Apache 2.0 |
+
+## Binary Weight Representation: 1-bit g128
+
+Each binary weight takes a value from {−1, +1} with one shared FP16 scale per group of 128 weights:
+
+```
+w_i = scale_g * b_i, b_i in {−1, +1}
+```
+
+Binary values carry exactly 1 bit of information per weight. With one FP16 scale per group of 128, the effective storage is
+
+```
+b_eff ≈ 1 + 16/128 ≈ 1.125 bits/weight
+```
+
+This gives an idealized **14.2× reduction** relative to FP16 for the binary transformer layers. A small set of precision-sensitive supporting tensors remains in FP16, so the final 1-bit Bonsai Image 4B diffusion transformer is **0.93 GB**, an 8.3× reduction from the 7.75 GB FP16 FLUX.2 Klein 4B transformer.
+
+The binary representation is applied to the matrix-heavy transformer layers, including Q / K / V projections, output projections, MLP linears, and the double-stream add-K / Q / V linears. Supporting tensors (less than 5% of the total parameters) such as modulation streams, embedders, output norm, and output projection remain FP16 for image quality and stability.
+
+### Memory
+
+| Format | Transformer size | Reduction | Ratio |
+| :------------------------- | ---------------: | --------: | -------: |
+| FP16 FLUX.2 Klein 4B | 7.75 GB | — | 1.0× |
+| **1-bit Bonsai Image 4B** | **0.93 GB** | **88.0%** | **8.3×** |
+
+Apple Silicon deployment:
+
+| Component | Size |
+| :------------------------------ | ------: |
+| MLX 1-bit diffusion transformer | 0.97 GB |
+| Compressed text encoder | 2.28 GB |
+| FP16 VAE | 0.17 GB |
+| **Total payload** | **3.42 GB** |
+
+At runtime, the text encoder is offloaded after prompt encoding. During denoising, the repeated image-generation loop is dominated by the compact binary diffusion transformer and active image-generation components rather than the full payload.
+
+End-to-end Mac M4 Pro mean-active memory pressure at 1024² is **1.95 GB** — a **7.4×** reduction vs the stock FP16 MFLUX pipeline (14.39 GB).
+
+## Best Practices
+
+- Sampler: FlowMatchEuler-discrete with 4 steps, guidance = 1.0 (no classifier-free guidance), shift = 3.0. The model is designed for 4 steps; running more steps does not improve quality significantly and can introduce artifacts.
+- Resolution: native 1024² is the design target; 512² works for quick previews.
+- Aspect ratios: multiples of 32 are supported, including 832×1248 and 1248×832.
+- Prompting: natural-language prompts. Negative prompts are not required.
+- Runtime memory: the text encoder is offloaded after prompt encoding, so the denoising loop is memory-light.
+
+## Quickstart
+
+### MLX (Python)
+
+The simplest path is the [Bonsai Image Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo), which sets up the full Bonsai Studio (FastAPI backend + Next.js frontend):
+
+```bash
+git clone https://github.com/PrismML-Eng/Bonsai-Image-Demo.git
+cd Bonsai-Image-Demo
+./setup.sh
+BONSAI_VARIANT=binary ./scripts/download_model.sh
+BONSAI_VARIANT=binary ./scripts/serve.sh
+```
+
+For a one-shot render without the studio frontend:
+
+```bash
+BONSAI_VARIANT=binary ./scripts/generate.sh --prompt "A bonsai tree in a quiet ceramic studio, soft morning light"
+```
+
+### MLX Swift (iOS / macOS)
+
+Binary Bonsai Image 4B runs natively on iPhone and iPad via MLX Swift. Bonsai Studio for iPhone is available on the App Store; under the hood, it loads this model with the kernels in our [mlx-swift fork](https://github.com/PrismML-Eng/mlx-swift).
+
+## Throughput (MLX / Apple Silicon)
+
+Mac M4 Pro (48 GB unified memory), 4 denoising steps, fixed prompt and seed:
+
+| Resolution | s / step | s / image (mean ± std) | vs stock MFLUX FP16 |
+| :------------ | -------: | ---------------------: | ------------------: |
+| 512 × 512 | 1.50 | 6.01 ± 0.31 s | **3.03×** |
+| 1024 × 1024 | 6.02 | **24.07 ± 0.03 s** | **5.60×** |
+
+iPhone 17 Pro Max (A19 Pro, 12 GB unified memory), MLX Swift, same methodology:
+
+| Resolution | s / step | s / image |
+| :------------ | -------: | --------: |
+| 128 × 128 | 0.68 | 2.7 s |
+| 256 × 256 | 0.95 | 3.8 s |
+| 512 × 512 | 2.35 | **9.4 s** |
+| 1024 × 1024 | 8.15 | **32.6 s**|
+
+Stock FP16 FLUX.2 Klein 4B does not fit within iPhone 17 Pro Max's 12 GB unified memory budget; Bonsai Image 4B models do.
+
+## Benchmarks
+
+Evaluated with matched generation settings across the comparison set on H100. GenEval uses the official 512x512 protocol. For HPSv3 and DPG-Bench, larger-backbone rows are evaluated at 1024x1024, while smaller-backbone rows are evaluated at their native 512x512 setting. Higher is better for all three benchmarks.
+
+| Model | Transformer (GB) | GenEval | HPSv3 | DPG-Bench |
+| :-------------------------- | ---------------: | ------: | -----: | --------: |
+| **Bonsai Image · Binary 4B**| **0.93** | **0.671** | **11.15** | **0.822** |
+| **Bonsai Image · Ternary 4B** | **1.21** | **0.723** | **12.22** | **0.851** |
+| FLUX.2 Klein 4B | 7.75 | 0.819 | 12.84 | 0.853 |
+| FLUX.1-schnell | 23.8 | 0.716 | 12.67 | 0.848 |
+| SDXL | 5.14 | 0.300 | 10.05 | 0.740 |
+| PixArt-Σ XL 2 | 1.20 | 0.541 | 11.93 | 0.769 |
+| Stable Diffusion 1.5 | 1.72 | 0.396 | 4.20 | 0.601 |
+| BK-SDM-Small | 0.98 | 0.297 | 3.05 | 0.559 |
+
+The benchmark results show the intended quality-footprint trade-off. 1-bit Bonsai Image 4B is the footprint-oriented variant: it reduces the diffusion transformer below 1 GB while still delivering strong GenEval, HPSv3, and DPG-Bench results. The ternary companion is the quality-oriented variant, using a slightly larger representation to achieve very close visual quality and prompt fidelity to the original FLUX.2 Klein 4B model.
+
+Together, the Bonsai Image variants move the quality-footprint frontier: they bring modern diffusion-transformer behavior into a memory range previously occupied by much smaller, lower-capability models.
+
+## Use Cases
+
+- **Local creative tooling**: image generation directly on Mac, iPhone, and iPad
+- **Private generation**: prompts and generated assets can remain local
+- **Rapid iteration**: lower local latency and no remote queue for iterative creative workflows
+- **Mobile deployment**: image generation on devices with unified-memory, thermal, and connectivity constraints
+- **Commodity-GPU serving**: lower transformer footprint and reduced memory pressure for serving on CUDA GPUs
+- **Enterprise and controlled inference**: local or private environments for data residency and compliance-sensitive workflows
+
+## Limitations
+
+- 1-bit Bonsai Image 4B is not bit-identical to the FP16 FLUX.2 Klein 4B model; it is a compact binary-weight deployment designed to deliver similar practical behavior at much smaller size.
+- Image-generation quality remains prompt- and workflow-dependent. Small text, fine details, object counts, and strict compositional constraints should be evaluated for the target use case.
+- Current commodity inference stacks do not yet expose fully native binary execution as a standard hardware path. This release uses practical MLX low-bit kernel paths on Apple Silicon and Gemlite low-bit GEMM on CUDA.
+- After the diffusion transformer is made compact, other components such as the VAE can become more visible memory bottlenecks. The runtime mitigates this with text-encoder offload and tiled VAE decoding.
+
+## Citation
+
+```bibtex
+@techreport{bonsaiimage4b,
+ title = {Bonsai Image 4B: Low-Bit Diffusion on Apple Silicon and Consumer GPUs},
+ author = {Prism ML},
+ year = {2026},
+ month = {May},
+ url = {https://prismml.com}
+}
+```
+
+## Contact
+
+For questions, feedback, or collaboration inquiries: **contact@prismml.com**
\ No newline at end of file
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/assets/bonsai-logo.svg b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/assets/bonsai-logo.svg
new file mode 100644
index 0000000..2cfef2b
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/assets/bonsai-logo.svg
@@ -0,0 +1 @@
+
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/manifest.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/manifest.json
new file mode 100644
index 0000000..25ddcda
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/manifest.json
@@ -0,0 +1,136 @@
+{
+ "model_version": "binary g128 (Apple Silicon mlx-1bit deployment)",
+ "total_bytes": 3428210856,
+ "files": [
+ {
+ "remote_path": "LICENSE",
+ "size": 10174,
+ "sha256": "69849221bfb90053de2134ef5e6d540287b4b98062326492f1f96f5da685524b"
+ },
+ {
+ "remote_path": "NOTICE.md",
+ "size": 623,
+ "sha256": "bbefa4a26b836efc040c1a0f155a425d1d833eae1b2534ffc414b1eada3cd922"
+ },
+ {
+ "remote_path": "README.md",
+ "size": 11996,
+ "sha256": "1527258bbdd58161a3241245985c78ad5503635fd32bc2d0d37634c192a574e5"
+ },
+ {
+ "remote_path": "model_index.json",
+ "size": 81,
+ "sha256": "ecb4735e37691a8733f62957fd6c548f841af40624905bb24fa639756153c8a1"
+ },
+ {
+ "remote_path": "scheduler/scheduler_config.json",
+ "size": 486,
+ "sha256": "067afb012cef64553a763447d1efd93daeffcc0123ca7e25b09f8de20b90762e"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/added_tokens.json",
+ "size": 707,
+ "sha256": "c0284b582e14987fbd3d5a2cb2bd139084371ed9acbae488829a1c900833c680"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/config.json",
+ "size": 937,
+ "sha256": "b5efdcf3b0035a3638e7228dad4d85f5c4a23f156eb7cdb0b44c8366a5d34d9b"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/merges.txt",
+ "size": 1671853,
+ "sha256": "8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/model.safetensors",
+ "size": 2263022529,
+ "sha256": "e240c0bdc0ebb0681bf0da0f98d9719fd6ebe269a3633f81542c13e81345651d"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/model.safetensors.index.json",
+ "size": 63924,
+ "sha256": "f7825defe5865d179c3b593173d37056be5f202dcb7153985cf74e75ecf1628b"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/special_tokens_map.json",
+ "size": 613,
+ "sha256": "76862e765266b85aa9459767e33cbaf13970f327a0e88d1c65846c2ddd3a1ecd"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/tokenizer.json",
+ "size": 11422654,
+ "sha256": "aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/tokenizer_config.json",
+ "size": 9706,
+ "sha256": "253153d0738ceb4c668d2eff957714dd2bea0b56de772a9fdccd96cbf517e6a0"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/vocab.json",
+ "size": 2776833,
+ "sha256": "ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910"
+ },
+ {
+ "remote_path": "tokenizer/added_tokens.json",
+ "size": 707,
+ "sha256": "c0284b582e14987fbd3d5a2cb2bd139084371ed9acbae488829a1c900833c680"
+ },
+ {
+ "remote_path": "tokenizer/chat_template.jinja",
+ "size": 4168,
+ "sha256": "a55ee1b1660128b7098723e0abcd92caa0788061051c62d51cbe87d9cf1974d8"
+ },
+ {
+ "remote_path": "tokenizer/merges.txt",
+ "size": 1671853,
+ "sha256": "8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5"
+ },
+ {
+ "remote_path": "tokenizer/special_tokens_map.json",
+ "size": 613,
+ "sha256": "76862e765266b85aa9459767e33cbaf13970f327a0e88d1c65846c2ddd3a1ecd"
+ },
+ {
+ "remote_path": "tokenizer/tokenizer.json",
+ "size": 11422654,
+ "sha256": "aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4"
+ },
+ {
+ "remote_path": "tokenizer/tokenizer_config.json",
+ "size": 5404,
+ "sha256": "443bfa629eb16387a12edbf92a76f6a6f10b2af3b53d87ba1550adfcf45f7fa0"
+ },
+ {
+ "remote_path": "tokenizer/vocab.json",
+ "size": 2776833,
+ "sha256": "ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910"
+ },
+ {
+ "remote_path": "transformer-packed-mflux/config.json",
+ "size": 619,
+ "sha256": "14c6d8314d28cc027ce636d52dfb98cecc11b65c1455bd51b394a971f4b7b49e"
+ },
+ {
+ "remote_path": "transformer-packed-mflux/diffusion_pytorch_model.safetensors",
+ "size": 965208136,
+ "sha256": "1792b31d857d95fcbe32df8e6d2fc96b30e800a195e295565d033deccea2dd75"
+ },
+ {
+ "remote_path": "transformer-packed-mflux/quantization_config.json",
+ "size": 5054,
+ "sha256": "ff8e78812e547f25868eff7b9a86cbcf7a91bee95f81f2bf0e039f198dbbabf0"
+ },
+ {
+ "remote_path": "vae/config.json",
+ "size": 821,
+ "sha256": "0d6dfb69ae95a5e2ac9836284bbb63d8b38ce67b25ba2dff380752b2a10ab948"
+ },
+ {
+ "remote_path": "vae/diffusion_pytorch_model.safetensors",
+ "size": 168120878,
+ "sha256": "ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04"
+ }
+ ]
+}
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/model_index.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/model_index.json
new file mode 100644
index 0000000..23fc542
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/model_index.json
@@ -0,0 +1,4 @@
+{
+ "_class_name": "Flux2KleinPipeline",
+ "_diffusers_version": "0.37.0.dev0"
+}
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/scheduler/scheduler_config.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/scheduler/scheduler_config.json
new file mode 100644
index 0000000..7e53605
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/scheduler/scheduler_config.json
@@ -0,0 +1,18 @@
+{
+ "_class_name": "FlowMatchEulerDiscreteScheduler",
+ "_diffusers_version": "0.37.0.dev0",
+ "base_image_seq_len": 256,
+ "base_shift": 0.5,
+ "invert_sigmas": false,
+ "max_image_seq_len": 4096,
+ "max_shift": 1.15,
+ "num_train_timesteps": 1000,
+ "shift": 3.0,
+ "shift_terminal": null,
+ "stochastic_sampling": false,
+ "time_shift_type": "exponential",
+ "use_beta_sigmas": false,
+ "use_dynamic_shifting": true,
+ "use_exponential_sigmas": false,
+ "use_karras_sigmas": false
+}
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/added_tokens.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/added_tokens.json
new file mode 100644
index 0000000..b54f913
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/added_tokens.json
@@ -0,0 +1,28 @@
+{
+ "": 151668,
+ " ": 151658,
+ "": 151666,
+ "": 151667,
+ "": 151657,
+ "": 151665,
+ "<|box_end|>": 151649,
+ "<|box_start|>": 151648,
+ "<|endoftext|>": 151643,
+ "<|file_sep|>": 151664,
+ "<|fim_middle|>": 151660,
+ "<|fim_pad|>": 151662,
+ "<|fim_prefix|>": 151659,
+ "<|fim_suffix|>": 151661,
+ "<|im_end|>": 151645,
+ "<|im_start|>": 151644,
+ "<|image_pad|>": 151655,
+ "<|object_ref_end|>": 151647,
+ "<|object_ref_start|>": 151646,
+ "<|quad_end|>": 151651,
+ "<|quad_start|>": 151650,
+ "<|repo_name|>": 151663,
+ "<|video_pad|>": 151656,
+ "<|vision_end|>": 151653,
+ "<|vision_pad|>": 151654,
+ "<|vision_start|>": 151652
+}
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/config.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/config.json
new file mode 100644
index 0000000..032ad32
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/config.json
@@ -0,0 +1,38 @@
+{
+ "architectures": [
+ "Qwen3ForCausalLM"
+ ],
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "bos_token_id": 151643,
+ "eos_token_id": 151645,
+ "head_dim": 128,
+ "hidden_act": "silu",
+ "hidden_size": 2560,
+ "initializer_range": 0.02,
+ "intermediate_size": 9728,
+ "max_position_embeddings": 40960,
+ "max_window_layers": 36,
+ "model_type": "qwen3",
+ "num_attention_heads": 32,
+ "num_hidden_layers": 36,
+ "num_key_value_heads": 8,
+ "quantization": {
+ "group_size": 64,
+ "bits": 4
+ },
+ "quantization_config": {
+ "group_size": 64,
+ "bits": 4
+ },
+ "rms_norm_eps": 1e-06,
+ "rope_scaling": null,
+ "rope_theta": 1000000,
+ "sliding_window": null,
+ "tie_word_embeddings": true,
+ "torch_dtype": "bfloat16",
+ "transformers_version": "4.51.0",
+ "use_cache": true,
+ "use_sliding_window": false,
+ "vocab_size": 151936
+}
\ No newline at end of file
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/merges.txt b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/merges.txt
new file mode 100644
index 0000000..80c1a19
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/merges.txt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5
+size 1671853
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/model.safetensors b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/model.safetensors
new file mode 100644
index 0000000..bb9a979
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e240c0bdc0ebb0681bf0da0f98d9719fd6ebe269a3633f81542c13e81345651d
+size 2263022529
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/model.safetensors.index.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/model.safetensors.index.json
new file mode 100644
index 0000000..07e230a
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/model.safetensors.index.json
@@ -0,0 +1,911 @@
+{
+ "metadata": {
+ "total_size": 2262920192
+ },
+ "weight_map": {
+ "model.embed_tokens.biases": "model.safetensors",
+ "model.embed_tokens.scales": "model.safetensors",
+ "model.embed_tokens.weight": "model.safetensors",
+ "model.layers.0.input_layernorm.weight": "model.safetensors",
+ "model.layers.0.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.0.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.0.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.0.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.0.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.0.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.0.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.0.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.0.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.0.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.0.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.0.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.0.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.0.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.0.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.0.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.0.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.0.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.0.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.0.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.0.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.0.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.0.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.0.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.1.input_layernorm.weight": "model.safetensors",
+ "model.layers.1.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.1.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.1.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.1.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.1.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.1.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.1.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.1.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.1.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.1.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.1.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.1.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.1.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.1.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.1.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.1.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.1.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.1.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.1.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.1.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.1.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.1.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.1.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.1.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.10.input_layernorm.weight": "model.safetensors",
+ "model.layers.10.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.10.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.10.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.10.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.10.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.10.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.10.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.10.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.10.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.10.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.10.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.10.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.10.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.10.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.10.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.10.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.10.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.10.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.10.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.10.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.10.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.10.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.10.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.10.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.11.input_layernorm.weight": "model.safetensors",
+ "model.layers.11.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.11.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.11.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.11.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.11.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.11.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.11.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.11.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.11.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.11.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.11.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.11.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.11.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.11.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.11.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.11.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.11.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.11.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.11.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.11.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.11.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.11.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.11.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.11.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.12.input_layernorm.weight": "model.safetensors",
+ "model.layers.12.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.12.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.12.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.12.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.12.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.12.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.12.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.12.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.12.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.12.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.12.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.12.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.12.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.12.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.12.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.12.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.12.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.12.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.12.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.12.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.12.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.12.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.12.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.12.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.13.input_layernorm.weight": "model.safetensors",
+ "model.layers.13.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.13.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.13.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.13.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.13.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.13.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.13.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.13.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.13.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.13.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.13.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.13.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.13.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.13.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.13.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.13.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.13.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.13.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.13.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.13.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.13.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.13.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.13.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.13.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.14.input_layernorm.weight": "model.safetensors",
+ "model.layers.14.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.14.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.14.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.14.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.14.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.14.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.14.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.14.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.14.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.14.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.14.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.14.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.14.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.14.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.14.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.14.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.14.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.14.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.14.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.14.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.14.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.14.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.14.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.14.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.15.input_layernorm.weight": "model.safetensors",
+ "model.layers.15.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.15.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.15.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.15.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.15.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.15.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.15.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.15.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.15.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.15.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.15.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.15.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.15.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.15.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.15.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.15.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.15.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.15.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.15.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.15.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.15.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.15.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.15.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.15.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.16.input_layernorm.weight": "model.safetensors",
+ "model.layers.16.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.16.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.16.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.16.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.16.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.16.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.16.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.16.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.16.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.16.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.16.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.16.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.16.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.16.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.16.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.16.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.16.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.16.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.16.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.16.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.16.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.16.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.16.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.16.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.17.input_layernorm.weight": "model.safetensors",
+ "model.layers.17.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.17.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.17.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.17.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.17.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.17.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.17.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.17.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.17.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.17.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.17.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.17.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.17.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.17.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.17.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.17.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.17.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.17.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.17.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.17.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.17.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.17.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.17.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.17.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.18.input_layernorm.weight": "model.safetensors",
+ "model.layers.18.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.18.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.18.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.18.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.18.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.18.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.18.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.18.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.18.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.18.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.18.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.18.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.18.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.18.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.18.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.18.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.18.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.18.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.18.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.18.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.18.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.18.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.18.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.18.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.19.input_layernorm.weight": "model.safetensors",
+ "model.layers.19.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.19.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.19.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.19.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.19.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.19.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.19.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.19.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.19.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.19.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.19.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.19.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.19.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.19.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.19.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.19.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.19.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.19.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.19.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.19.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.19.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.19.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.19.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.19.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.2.input_layernorm.weight": "model.safetensors",
+ "model.layers.2.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.2.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.2.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.2.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.2.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.2.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.2.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.2.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.2.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.2.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.2.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.2.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.2.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.2.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.2.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.2.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.2.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.2.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.2.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.2.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.2.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.2.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.2.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.2.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.20.input_layernorm.weight": "model.safetensors",
+ "model.layers.20.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.20.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.20.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.20.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.20.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.20.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.20.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.20.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.20.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.20.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.20.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.20.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.20.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.20.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.20.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.20.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.20.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.20.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.20.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.20.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.20.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.20.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.20.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.20.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.21.input_layernorm.weight": "model.safetensors",
+ "model.layers.21.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.21.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.21.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.21.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.21.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.21.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.21.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.21.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.21.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.21.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.21.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.21.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.21.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.21.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.21.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.21.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.21.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.21.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.21.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.21.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.21.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.21.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.21.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.21.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.22.input_layernorm.weight": "model.safetensors",
+ "model.layers.22.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.22.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.22.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.22.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.22.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.22.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.22.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.22.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.22.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.22.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.22.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.22.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.22.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.22.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.22.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.22.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.22.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.22.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.22.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.22.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.22.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.22.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.22.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.22.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.23.input_layernorm.weight": "model.safetensors",
+ "model.layers.23.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.23.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.23.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.23.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.23.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.23.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.23.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.23.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.23.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.23.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.23.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.23.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.23.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.23.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.23.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.23.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.23.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.23.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.23.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.23.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.23.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.23.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.23.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.23.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.24.input_layernorm.weight": "model.safetensors",
+ "model.layers.24.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.24.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.24.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.24.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.24.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.24.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.24.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.24.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.24.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.24.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.24.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.24.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.24.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.24.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.24.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.24.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.24.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.24.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.24.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.24.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.24.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.24.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.24.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.24.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.25.input_layernorm.weight": "model.safetensors",
+ "model.layers.25.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.25.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.25.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.25.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.25.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.25.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.25.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.25.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.25.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.25.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.25.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.25.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.25.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.25.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.25.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.25.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.25.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.25.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.25.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.25.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.25.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.25.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.25.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.25.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.26.input_layernorm.weight": "model.safetensors",
+ "model.layers.26.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.26.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.26.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.26.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.26.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.26.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.26.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.26.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.26.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.26.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.26.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.26.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.26.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.26.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.26.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.26.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.26.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.26.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.26.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.26.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.26.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.26.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.26.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.26.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.27.input_layernorm.weight": "model.safetensors",
+ "model.layers.27.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.27.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.27.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.27.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.27.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.27.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.27.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.27.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.27.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.27.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.27.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.27.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.27.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.27.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.27.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.27.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.27.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.27.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.27.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.27.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.27.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.27.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.27.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.27.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.28.input_layernorm.weight": "model.safetensors",
+ "model.layers.28.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.28.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.28.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.28.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.28.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.28.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.28.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.28.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.28.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.28.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.28.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.28.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.28.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.28.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.28.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.28.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.28.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.28.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.28.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.28.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.28.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.28.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.28.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.28.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.29.input_layernorm.weight": "model.safetensors",
+ "model.layers.29.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.29.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.29.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.29.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.29.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.29.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.29.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.29.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.29.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.29.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.29.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.29.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.29.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.29.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.29.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.29.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.29.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.29.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.29.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.29.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.29.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.29.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.29.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.29.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.3.input_layernorm.weight": "model.safetensors",
+ "model.layers.3.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.3.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.3.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.3.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.3.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.3.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.3.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.3.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.3.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.3.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.3.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.3.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.3.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.3.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.3.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.3.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.3.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.3.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.3.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.3.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.3.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.3.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.3.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.3.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.30.input_layernorm.weight": "model.safetensors",
+ "model.layers.30.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.30.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.30.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.30.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.30.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.30.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.30.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.30.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.30.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.30.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.30.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.30.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.30.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.30.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.30.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.30.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.30.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.30.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.30.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.30.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.30.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.30.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.30.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.30.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.31.input_layernorm.weight": "model.safetensors",
+ "model.layers.31.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.31.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.31.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.31.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.31.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.31.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.31.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.31.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.31.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.31.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.31.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.31.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.31.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.31.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.31.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.31.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.31.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.31.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.31.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.31.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.31.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.31.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.31.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.31.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.32.input_layernorm.weight": "model.safetensors",
+ "model.layers.32.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.32.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.32.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.32.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.32.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.32.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.32.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.32.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.32.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.32.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.32.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.32.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.32.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.32.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.32.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.32.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.32.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.32.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.32.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.32.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.32.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.32.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.32.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.32.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.33.input_layernorm.weight": "model.safetensors",
+ "model.layers.33.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.33.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.33.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.33.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.33.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.33.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.33.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.33.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.33.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.33.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.33.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.33.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.33.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.33.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.33.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.33.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.33.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.33.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.33.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.33.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.33.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.33.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.33.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.33.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.34.input_layernorm.weight": "model.safetensors",
+ "model.layers.34.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.34.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.34.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.34.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.34.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.34.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.34.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.34.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.34.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.34.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.34.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.34.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.34.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.34.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.34.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.34.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.34.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.34.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.34.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.34.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.34.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.34.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.34.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.34.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.35.input_layernorm.weight": "model.safetensors",
+ "model.layers.35.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.35.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.35.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.35.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.35.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.35.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.35.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.35.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.35.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.35.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.35.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.35.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.35.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.35.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.35.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.35.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.35.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.35.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.35.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.35.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.35.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.35.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.35.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.35.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.4.input_layernorm.weight": "model.safetensors",
+ "model.layers.4.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.4.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.4.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.4.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.4.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.4.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.4.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.4.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.4.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.4.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.4.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.4.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.4.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.4.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.4.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.4.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.4.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.4.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.4.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.4.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.4.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.4.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.4.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.4.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.5.input_layernorm.weight": "model.safetensors",
+ "model.layers.5.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.5.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.5.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.5.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.5.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.5.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.5.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.5.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.5.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.5.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.5.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.5.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.5.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.5.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.5.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.5.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.5.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.5.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.5.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.5.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.5.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.5.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.5.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.5.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.6.input_layernorm.weight": "model.safetensors",
+ "model.layers.6.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.6.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.6.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.6.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.6.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.6.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.6.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.6.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.6.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.6.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.6.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.6.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.6.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.6.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.6.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.6.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.6.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.6.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.6.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.6.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.6.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.6.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.6.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.6.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.7.input_layernorm.weight": "model.safetensors",
+ "model.layers.7.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.7.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.7.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.7.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.7.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.7.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.7.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.7.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.7.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.7.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.7.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.7.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.7.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.7.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.7.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.7.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.7.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.7.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.7.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.7.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.7.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.7.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.7.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.7.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.8.input_layernorm.weight": "model.safetensors",
+ "model.layers.8.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.8.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.8.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.8.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.8.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.8.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.8.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.8.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.8.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.8.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.8.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.8.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.8.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.8.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.8.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.8.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.8.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.8.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.8.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.8.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.8.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.8.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.8.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.8.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.9.input_layernorm.weight": "model.safetensors",
+ "model.layers.9.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.9.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.9.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.9.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.9.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.9.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.9.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.9.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.9.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.9.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.9.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.9.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.9.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.9.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.9.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.9.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.9.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.9.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.9.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.9.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.9.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.9.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.9.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.9.self_attn.v_proj.weight": "model.safetensors",
+ "model.norm.weight": "model.safetensors"
+ }
+}
\ No newline at end of file
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/special_tokens_map.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/special_tokens_map.json
new file mode 100644
index 0000000..ac23c0a
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/special_tokens_map.json
@@ -0,0 +1,31 @@
+{
+ "additional_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "eos_token": {
+ "content": "<|im_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "pad_token": {
+ "content": "<|endoftext|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ }
+}
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/tokenizer.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/tokenizer.json
new file mode 100644
index 0000000..cd71f61
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4
+size 11422654
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/tokenizer_config.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/tokenizer_config.json
new file mode 100644
index 0000000..7345216
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/tokenizer_config.json
@@ -0,0 +1,240 @@
+{
+ "add_bos_token": false,
+ "add_prefix_space": false,
+ "added_tokens_decoder": {
+ "151643": {
+ "content": "<|endoftext|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151644": {
+ "content": "<|im_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151645": {
+ "content": "<|im_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151646": {
+ "content": "<|object_ref_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151647": {
+ "content": "<|object_ref_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151648": {
+ "content": "<|box_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151649": {
+ "content": "<|box_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151650": {
+ "content": "<|quad_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151651": {
+ "content": "<|quad_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151652": {
+ "content": "<|vision_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151653": {
+ "content": "<|vision_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151654": {
+ "content": "<|vision_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151655": {
+ "content": "<|image_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151656": {
+ "content": "<|video_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151657": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151658": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151659": {
+ "content": "<|fim_prefix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151660": {
+ "content": "<|fim_middle|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151661": {
+ "content": "<|fim_suffix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151662": {
+ "content": "<|fim_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151663": {
+ "content": "<|repo_name|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151664": {
+ "content": "<|file_sep|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151665": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151666": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151667": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151668": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ }
+ },
+ "additional_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "bos_token": null,
+ "chat_template": "{%- if tools %}\n {{- '<|im_start|>system\\n' }}\n {%- if messages[0].role == 'system' %}\n {{- messages[0].content + '\\n\\n' }}\n {%- endif %}\n {{- \"# Tools\\n\\nYou may call one or more functions to assist with the user query.\\n\\nYou are provided with function signatures within XML tags:\\n\" }}\n {%- for tool in tools %}\n {{- \"\\n\" }}\n {{- tool | tojson }}\n {%- endfor %}\n {{- \"\\n \\n\\nFor each function call, return a json object with function name and arguments within XML tags:\\n\\n{\\\"name\\\": , \\\"arguments\\\": }\\n <|im_end|>\\n\" }}\n{%- else %}\n {%- if messages[0].role == 'system' %}\n {{- '<|im_start|>system\\n' + messages[0].content + '<|im_end|>\\n' }}\n {%- endif %}\n{%- endif %}\n{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}\n{%- for message in messages[::-1] %}\n {%- set index = (messages|length - 1) - loop.index0 %}\n {%- if ns.multi_step_tool and message.role == \"user\" and not(message.content.startswith('') and message.content.endswith(' ')) %}\n {%- set ns.multi_step_tool = false %}\n {%- set ns.last_query_index = index %}\n {%- endif %}\n{%- endfor %}\n{%- for message in messages %}\n {%- if (message.role == \"user\") or (message.role == \"system\" and not loop.first) %}\n {{- '<|im_start|>' + message.role + '\\n' + message.content + '<|im_end|>' + '\\n' }}\n {%- elif message.role == \"assistant\" %}\n {%- set content = message.content %}\n {%- set reasoning_content = '' %}\n {%- if message.reasoning_content is defined and message.reasoning_content is not none %}\n {%- set reasoning_content = message.reasoning_content %}\n {%- else %}\n {%- if ' ' in message.content %}\n {%- set content = message.content.split('')[-1].lstrip('\\n') %}\n {%- set reasoning_content = message.content.split('')[0].rstrip('\\n').split('')[-1].lstrip('\\n') %}\n {%- endif %}\n {%- endif %}\n {%- if loop.index0 > ns.last_query_index %}\n {%- if loop.last or (not loop.last and reasoning_content) %}\n {{- '<|im_start|>' + message.role + '\\n\\n' + reasoning_content.strip('\\n') + '\\n \\n\\n' + content.lstrip('\\n') }}\n {%- else %}\n {{- '<|im_start|>' + message.role + '\\n' + content }}\n {%- endif %}\n {%- else %}\n {{- '<|im_start|>' + message.role + '\\n' + content }}\n {%- endif %}\n {%- if message.tool_calls %}\n {%- for tool_call in message.tool_calls %}\n {%- if (loop.first and content) or (not loop.first) %}\n {{- '\\n' }}\n {%- endif %}\n {%- if tool_call.function %}\n {%- set tool_call = tool_call.function %}\n {%- endif %}\n {{- '\\n{\"name\": \"' }}\n {{- tool_call.name }}\n {{- '\", \"arguments\": ' }}\n {%- if tool_call.arguments is string %}\n {{- tool_call.arguments }}\n {%- else %}\n {{- tool_call.arguments | tojson }}\n {%- endif %}\n {{- '}\\n ' }}\n {%- endfor %}\n {%- endif %}\n {{- '<|im_end|>\\n' }}\n {%- elif message.role == \"tool\" %}\n {%- if loop.first or (messages[loop.index0 - 1].role != \"tool\") %}\n {{- '<|im_start|>user' }}\n {%- endif %}\n {{- '\\n\\n' }}\n {{- message.content }}\n {{- '\\n ' }}\n {%- if loop.last or (messages[loop.index0 + 1].role != \"tool\") %}\n {{- '<|im_end|>\\n' }}\n {%- endif %}\n {%- endif %}\n{%- endfor %}\n{%- if add_generation_prompt %}\n {{- '<|im_start|>assistant\\n' }}\n {%- if enable_thinking is defined and enable_thinking is false %}\n {{- '\\n\\n \\n\\n' }}\n {%- endif %}\n{%- endif %}",
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": {},
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/vocab.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/vocab.json
new file mode 100644
index 0000000..6c49fc6
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/vocab.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910
+size 2776833
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/added_tokens.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/added_tokens.json
new file mode 100644
index 0000000..b54f913
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/added_tokens.json
@@ -0,0 +1,28 @@
+{
+ " ": 151668,
+ " ": 151658,
+ "": 151666,
+ "": 151667,
+ "": 151657,
+ "": 151665,
+ "<|box_end|>": 151649,
+ "<|box_start|>": 151648,
+ "<|endoftext|>": 151643,
+ "<|file_sep|>": 151664,
+ "<|fim_middle|>": 151660,
+ "<|fim_pad|>": 151662,
+ "<|fim_prefix|>": 151659,
+ "<|fim_suffix|>": 151661,
+ "<|im_end|>": 151645,
+ "<|im_start|>": 151644,
+ "<|image_pad|>": 151655,
+ "<|object_ref_end|>": 151647,
+ "<|object_ref_start|>": 151646,
+ "<|quad_end|>": 151651,
+ "<|quad_start|>": 151650,
+ "<|repo_name|>": 151663,
+ "<|video_pad|>": 151656,
+ "<|vision_end|>": 151653,
+ "<|vision_pad|>": 151654,
+ "<|vision_start|>": 151652
+}
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/chat_template.jinja b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/chat_template.jinja
new file mode 100644
index 0000000..01be9b3
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/chat_template.jinja
@@ -0,0 +1,89 @@
+{%- if tools %}
+ {{- '<|im_start|>system\n' }}
+ {%- if messages[0].role == 'system' %}
+ {{- messages[0].content + '\n\n' }}
+ {%- endif %}
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n \n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n <|im_end|>\n" }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith(' ')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+{%- endfor %}
+{%- for message in messages %}
+ {%- if message.content is string %}
+ {%- set content = message.content %}
+ {%- else %}
+ {%- set content = '' %}
+ {%- endif %}
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if ' ' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split(' ')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {%- if loop.last or (not loop.last and reasoning_content) %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n \n\n' + content.lstrip('\n') }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if (loop.first and content) or (not loop.first) %}
+ {{- '\n' }}
+ {%- endif %}
+ {%- if tool_call.function %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {{- '\n{"name": "' }}
+ {{- tool_call.name }}
+ {{- '", "arguments": ' }}
+ {%- if tool_call.arguments is string %}
+ {{- tool_call.arguments }}
+ {%- else %}
+ {{- tool_call.arguments | tojson }}
+ {%- endif %}
+ {{- '}\n ' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n ' }}
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n \n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/merges.txt b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/merges.txt
new file mode 100644
index 0000000..80c1a19
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/merges.txt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5
+size 1671853
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/special_tokens_map.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/special_tokens_map.json
new file mode 100644
index 0000000..ac23c0a
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/special_tokens_map.json
@@ -0,0 +1,31 @@
+{
+ "additional_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "eos_token": {
+ "content": "<|im_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "pad_token": {
+ "content": "<|endoftext|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ }
+}
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/tokenizer.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/tokenizer.json
new file mode 100644
index 0000000..cd71f61
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4
+size 11422654
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/tokenizer_config.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/tokenizer_config.json
new file mode 100644
index 0000000..ddaf698
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/tokenizer_config.json
@@ -0,0 +1,239 @@
+{
+ "add_bos_token": false,
+ "add_prefix_space": false,
+ "added_tokens_decoder": {
+ "151643": {
+ "content": "<|endoftext|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151644": {
+ "content": "<|im_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151645": {
+ "content": "<|im_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151646": {
+ "content": "<|object_ref_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151647": {
+ "content": "<|object_ref_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151648": {
+ "content": "<|box_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151649": {
+ "content": "<|box_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151650": {
+ "content": "<|quad_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151651": {
+ "content": "<|quad_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151652": {
+ "content": "<|vision_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151653": {
+ "content": "<|vision_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151654": {
+ "content": "<|vision_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151655": {
+ "content": "<|image_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151656": {
+ "content": "<|video_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151657": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151658": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151659": {
+ "content": "<|fim_prefix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151660": {
+ "content": "<|fim_middle|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151661": {
+ "content": "<|fim_suffix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151662": {
+ "content": "<|fim_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151663": {
+ "content": "<|repo_name|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151664": {
+ "content": "<|file_sep|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151665": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151666": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151667": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151668": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ }
+ },
+ "additional_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": {},
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/vocab.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/vocab.json
new file mode 100644
index 0000000..6c49fc6
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/vocab.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910
+size 2776833
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/config.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/config.json
new file mode 100644
index 0000000..b8badc8
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/config.json
@@ -0,0 +1,27 @@
+{
+ "_class_name": "Flux2Transformer2DModel",
+ "_diffusers_version": "0.37.1",
+ "_name_or_path": "black-forest-labs/FLUX.2-klein-4B",
+ "attention_head_dim": 128,
+ "axes_dims_rope": [
+ 32,
+ 32,
+ 32,
+ 32
+ ],
+ "enable_time_sign_embed": false,
+ "eps": 1e-06,
+ "guidance_embeds": false,
+ "in_channels": 128,
+ "joint_attention_dim": 7680,
+ "mlp_ratio": 3.0,
+ "musubi_block_swap_device": "cpu",
+ "musubi_blocks_to_swap": 0,
+ "num_attention_heads": 24,
+ "num_layers": 5,
+ "num_single_layers": 20,
+ "out_channels": null,
+ "patch_size": 1,
+ "rope_theta": 2000,
+ "timestep_guidance_channels": 256
+}
\ No newline at end of file
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/diffusion_pytorch_model.safetensors b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/diffusion_pytorch_model.safetensors
new file mode 100644
index 0000000..0a63d50
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/diffusion_pytorch_model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:1792b31d857d95fcbe32df8e6d2fc96b30e800a195e295565d033deccea2dd75
+size 965208136
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/quantization_config.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/quantization_config.json
new file mode 100644
index 0000000..8ca5572
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/quantization_config.json
@@ -0,0 +1,120 @@
+{
+ "format": "prism-packed-affine",
+ "solver": "affine",
+ "bits": 1,
+ "group_size": 128,
+ "scale_dtype": "bfloat16",
+ "skip_patterns": [
+ "proj_out",
+ "x_embedder",
+ "context_embedder",
+ "time_text_embed",
+ "time_guidance_embed",
+ "norm_out",
+ "double_stream_modulation_img",
+ "double_stream_modulation_txt",
+ "single_stream_modulation"
+ ],
+ "quantized_modules": [
+ "single_transformer_blocks.0.attn.to_out",
+ "single_transformer_blocks.0.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.1.attn.to_out",
+ "single_transformer_blocks.1.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.10.attn.to_out",
+ "single_transformer_blocks.10.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.11.attn.to_out",
+ "single_transformer_blocks.11.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.12.attn.to_out",
+ "single_transformer_blocks.12.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.13.attn.to_out",
+ "single_transformer_blocks.13.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.14.attn.to_out",
+ "single_transformer_blocks.14.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.15.attn.to_out",
+ "single_transformer_blocks.15.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.16.attn.to_out",
+ "single_transformer_blocks.16.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.17.attn.to_out",
+ "single_transformer_blocks.17.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.18.attn.to_out",
+ "single_transformer_blocks.18.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.19.attn.to_out",
+ "single_transformer_blocks.19.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.2.attn.to_out",
+ "single_transformer_blocks.2.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.3.attn.to_out",
+ "single_transformer_blocks.3.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.4.attn.to_out",
+ "single_transformer_blocks.4.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.5.attn.to_out",
+ "single_transformer_blocks.5.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.6.attn.to_out",
+ "single_transformer_blocks.6.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.7.attn.to_out",
+ "single_transformer_blocks.7.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.8.attn.to_out",
+ "single_transformer_blocks.8.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.9.attn.to_out",
+ "single_transformer_blocks.9.attn.to_qkv_mlp_proj",
+ "transformer_blocks.0.attn.add_k_proj",
+ "transformer_blocks.0.attn.add_q_proj",
+ "transformer_blocks.0.attn.add_v_proj",
+ "transformer_blocks.0.attn.to_add_out",
+ "transformer_blocks.0.attn.to_k",
+ "transformer_blocks.0.attn.to_out.0",
+ "transformer_blocks.0.attn.to_q",
+ "transformer_blocks.0.attn.to_v",
+ "transformer_blocks.0.ff.linear_in",
+ "transformer_blocks.0.ff.linear_out",
+ "transformer_blocks.0.ff_context.linear_in",
+ "transformer_blocks.0.ff_context.linear_out",
+ "transformer_blocks.1.attn.add_k_proj",
+ "transformer_blocks.1.attn.add_q_proj",
+ "transformer_blocks.1.attn.add_v_proj",
+ "transformer_blocks.1.attn.to_add_out",
+ "transformer_blocks.1.attn.to_k",
+ "transformer_blocks.1.attn.to_out.0",
+ "transformer_blocks.1.attn.to_q",
+ "transformer_blocks.1.attn.to_v",
+ "transformer_blocks.1.ff.linear_in",
+ "transformer_blocks.1.ff.linear_out",
+ "transformer_blocks.1.ff_context.linear_in",
+ "transformer_blocks.1.ff_context.linear_out",
+ "transformer_blocks.2.attn.add_k_proj",
+ "transformer_blocks.2.attn.add_q_proj",
+ "transformer_blocks.2.attn.add_v_proj",
+ "transformer_blocks.2.attn.to_add_out",
+ "transformer_blocks.2.attn.to_k",
+ "transformer_blocks.2.attn.to_out.0",
+ "transformer_blocks.2.attn.to_q",
+ "transformer_blocks.2.attn.to_v",
+ "transformer_blocks.2.ff.linear_in",
+ "transformer_blocks.2.ff.linear_out",
+ "transformer_blocks.2.ff_context.linear_in",
+ "transformer_blocks.2.ff_context.linear_out",
+ "transformer_blocks.3.attn.add_k_proj",
+ "transformer_blocks.3.attn.add_q_proj",
+ "transformer_blocks.3.attn.add_v_proj",
+ "transformer_blocks.3.attn.to_add_out",
+ "transformer_blocks.3.attn.to_k",
+ "transformer_blocks.3.attn.to_out.0",
+ "transformer_blocks.3.attn.to_q",
+ "transformer_blocks.3.attn.to_v",
+ "transformer_blocks.3.ff.linear_in",
+ "transformer_blocks.3.ff.linear_out",
+ "transformer_blocks.3.ff_context.linear_in",
+ "transformer_blocks.3.ff_context.linear_out",
+ "transformer_blocks.4.attn.add_k_proj",
+ "transformer_blocks.4.attn.add_q_proj",
+ "transformer_blocks.4.attn.add_v_proj",
+ "transformer_blocks.4.attn.to_add_out",
+ "transformer_blocks.4.attn.to_k",
+ "transformer_blocks.4.attn.to_out.0",
+ "transformer_blocks.4.attn.to_q",
+ "transformer_blocks.4.attn.to_v",
+ "transformer_blocks.4.ff.linear_in",
+ "transformer_blocks.4.ff.linear_out",
+ "transformer_blocks.4.ff_context.linear_in",
+ "transformer_blocks.4.ff_context.linear_out"
+ ]
+}
\ No newline at end of file
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/vae/config.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/vae/config.json
new file mode 100644
index 0000000..c3f38eb
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/vae/config.json
@@ -0,0 +1,40 @@
+{
+ "_class_name": "AutoencoderKLFlux2",
+ "_diffusers_version": "0.37.0.dev0",
+ "_name_or_path": "black-forest-labs/FLUX.2-dev",
+ "act_fn": "silu",
+ "batch_norm_eps": 0.0001,
+ "batch_norm_momentum": 0.1,
+ "block_out_channels": [
+ 128,
+ 256,
+ 512,
+ 512
+ ],
+ "down_block_types": [
+ "DownEncoderBlock2D",
+ "DownEncoderBlock2D",
+ "DownEncoderBlock2D",
+ "DownEncoderBlock2D"
+ ],
+ "force_upcast": true,
+ "in_channels": 3,
+ "latent_channels": 32,
+ "layers_per_block": 2,
+ "mid_block_add_attention": true,
+ "norm_num_groups": 32,
+ "out_channels": 3,
+ "patch_size": [
+ 2,
+ 2
+ ],
+ "sample_size": 1024,
+ "up_block_types": [
+ "UpDecoderBlock2D",
+ "UpDecoderBlock2D",
+ "UpDecoderBlock2D",
+ "UpDecoderBlock2D"
+ ],
+ "use_post_quant_conv": true,
+ "use_quant_conv": true
+}
diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/vae/diffusion_pytorch_model.safetensors b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/vae/diffusion_pytorch_model.safetensors
new file mode 100644
index 0000000..0654e17
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/vae/diffusion_pytorch_model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04
+size 168120878
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/.gitattributes b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/.gitattributes
new file mode 100644
index 0000000..74614b5
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/.gitattributes
@@ -0,0 +1,37 @@
+*.7z filter=lfs diff=lfs merge=lfs -text
+*.arrow filter=lfs diff=lfs merge=lfs -text
+*.bin filter=lfs diff=lfs merge=lfs -text
+*.bz2 filter=lfs diff=lfs merge=lfs -text
+*.ckpt filter=lfs diff=lfs merge=lfs -text
+*.ftz filter=lfs diff=lfs merge=lfs -text
+*.gz filter=lfs diff=lfs merge=lfs -text
+*.h5 filter=lfs diff=lfs merge=lfs -text
+*.joblib filter=lfs diff=lfs merge=lfs -text
+*.lfs.* filter=lfs diff=lfs merge=lfs -text
+*.mlmodel filter=lfs diff=lfs merge=lfs -text
+*.model filter=lfs diff=lfs merge=lfs -text
+*.msgpack filter=lfs diff=lfs merge=lfs -text
+*.npy filter=lfs diff=lfs merge=lfs -text
+*.npz filter=lfs diff=lfs merge=lfs -text
+*.onnx filter=lfs diff=lfs merge=lfs -text
+*.ot filter=lfs diff=lfs merge=lfs -text
+*.parquet filter=lfs diff=lfs merge=lfs -text
+*.pb filter=lfs diff=lfs merge=lfs -text
+*.pickle filter=lfs diff=lfs merge=lfs -text
+*.pkl filter=lfs diff=lfs merge=lfs -text
+*.pt filter=lfs diff=lfs merge=lfs -text
+*.pth filter=lfs diff=lfs merge=lfs -text
+*.rar filter=lfs diff=lfs merge=lfs -text
+*.safetensors filter=lfs diff=lfs merge=lfs -text
+saved_model/**/* filter=lfs diff=lfs merge=lfs -text
+*.tar.* filter=lfs diff=lfs merge=lfs -text
+*.tar filter=lfs diff=lfs merge=lfs -text
+*.tflite filter=lfs diff=lfs merge=lfs -text
+*.tgz filter=lfs diff=lfs merge=lfs -text
+*.wasm filter=lfs diff=lfs merge=lfs -text
+*.xz filter=lfs diff=lfs merge=lfs -text
+*.zip filter=lfs diff=lfs merge=lfs -text
+*.zst filter=lfs diff=lfs merge=lfs -text
+*tfevents* filter=lfs diff=lfs merge=lfs -text
+text_encoder-mlx-4bit/tokenizer.json filter=lfs diff=lfs merge=lfs -text
+tokenizer/tokenizer.json filter=lfs diff=lfs merge=lfs -text
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/LICENSE b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/LICENSE
new file mode 100644
index 0000000..66a27ec
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/LICENSE
@@ -0,0 +1,177 @@
+ Apache License
+ Version 2.0, January 2004
+ http://www.apache.org/licenses/
+
+ TERMS AND CONDITIONS FOR USE, REPRODUCTION, AND DISTRIBUTION
+
+ 1. Definitions.
+
+ "License" shall mean the terms and conditions for use, reproduction,
+ and distribution as defined by Sections 1 through 9 of this document.
+
+ "Licensor" shall mean the copyright owner or entity authorized by
+ the copyright owner that is granting the License.
+
+ "Legal Entity" shall mean the union of the acting entity and all
+ other entities that control, are controlled by, or are under common
+ control with that entity. For the purposes of this definition,
+ "control" means (i) the power, direct or indirect, to cause the
+ direction or management of such entity, whether by contract or
+ otherwise, or (ii) ownership of fifty percent (50%) or more of the
+ outstanding shares, or (iii) beneficial ownership of such entity.
+
+ "You" (or "Your") shall mean an individual or Legal Entity
+ exercising permissions granted by this License.
+
+ "Source" form shall mean the preferred form for making modifications,
+ including but not limited to software source code, documentation
+ source, and configuration files.
+
+ "Object" form shall mean any form resulting from mechanical
+ transformation or translation of a Source form, including but
+ not limited to compiled object code, generated documentation,
+ and conversions to other media types.
+
+ "Work" shall mean the work of authorship, whether in Source or
+ Object form, made available under the License, as indicated by a
+ copyright notice that is included in or attached to the work
+ (an example is provided in the Appendix below).
+
+ "Derivative Works" shall mean any work, whether in Source or Object
+ form, that is based on (or derived from) the Work and for which the
+ editorial revisions, annotations, elaborations, or other modifications
+ represent, as a whole, an original work of authorship. For the purposes
+ of this License, Derivative Works shall not include works that remain
+ separable from, or merely link (or bind by name) to the interfaces of,
+ the Work and Derivative Works thereof.
+
+ "Contribution" shall mean any work of authorship, including
+ the original version of the Work and any modifications or additions
+ to that Work or Derivative Works thereof, that is intentionally
+ submitted to Licensor for inclusion in the Work by the copyright owner
+ or by an individual or Legal Entity authorized to submit on behalf of
+ the copyright owner. For the purposes of this definition, "submitted"
+ means any form of electronic, verbal, or written communication sent
+ to the Licensor or its representatives, including but not limited to
+ communication on electronic mailing lists, source code control systems,
+ and issue tracking systems that are managed by, or on behalf of, the
+ Licensor for the purpose of discussing and improving the Work, but
+ excluding communication that is conspicuously marked or otherwise
+ designated in writing by the copyright owner as "Not a Contribution."
+
+ "Contributor" shall mean Licensor and any individual or Legal Entity
+ on behalf of whom a Contribution has been received by Licensor and
+ subsequently incorporated within the Work.
+
+ 2. Grant of Copyright License. Subject to the terms and conditions of
+ this License, each Contributor hereby grants to You a perpetual,
+ worldwide, non-exclusive, no-charge, royalty-free, irrevocable
+ copyright license to reproduce, prepare Derivative Works of,
+ publicly display, publicly perform, sublicense, and distribute the
+ Work and such Derivative Works in Source or Object form.
+
+ 3. Grant of Patent License. Subject to the terms and conditions of
+ this License, each Contributor hereby grants to You a perpetual,
+ worldwide, non-exclusive, no-charge, royalty-free, irrevocable
+ (except as stated in this section) patent license to make, have made,
+ use, offer to sell, sell, import, and otherwise transfer the Work,
+ where such license applies only to those patent claims licensable
+ by such Contributor that are necessarily infringed by their
+ Contribution(s) alone or by combination of their Contribution(s)
+ with the Work to which such Contribution(s) was submitted. If You
+ institute patent litigation against any entity (including a
+ cross-claim or counterclaim in a lawsuit) alleging that the Work
+ or a Contribution incorporated within the Work constitutes direct
+ or contributory patent infringement, then any patent licenses
+ granted to You under this License for that Work shall terminate
+ as of the date such litigation is filed.
+
+ 4. Redistribution. You may reproduce and distribute copies of the
+ Work or Derivative Works thereof in any medium, with or without
+ modifications, and in Source or Object form, provided that You
+ meet the following conditions:
+
+ (a) You must give any other recipients of the Work or
+ Derivative Works a copy of this License; and
+
+ (b) You must cause any modified files to carry prominent notices
+ stating that You changed the files; and
+
+ (c) You must retain, in the Source form of any Derivative Works
+ that You distribute, all copyright, patent, trademark, and
+ attribution notices from the Source form of the Work,
+ excluding those notices that do not pertain to any part of
+ the Derivative Works; and
+
+ (d) If the Work includes a "NOTICE" text file as part of its
+ distribution, then any Derivative Works that You distribute must
+ include a readable copy of the attribution notices contained
+ within such NOTICE file, excluding those notices that do not
+ pertain to any part of the Derivative Works, in at least one
+ of the following places: within a NOTICE text file distributed
+ as part of the Derivative Works; within the Source form or
+ documentation, if provided along with the Derivative Works; or,
+ within a display generated by the Derivative Works, if and
+ wherever such third-party notices normally appear. The contents
+ of the NOTICE file are for informational purposes only and
+ do not modify the License. You may add Your own attribution
+ notices within Derivative Works that You distribute, alongside
+ or as an addendum to the NOTICE text from the Work, provided
+ that such additional attribution notices cannot be construed
+ as modifying the License.
+
+ You may add Your own copyright statement to Your modifications and
+ may provide additional or different license terms and conditions
+ for use, reproduction, or distribution of Your modifications, or
+ for any such Derivative Works as a whole, provided Your use,
+ reproduction, and distribution of the Work otherwise complies with
+ the conditions stated in this License.
+
+ 5. Submission of Contributions. Unless You explicitly state otherwise,
+ any Contribution intentionally submitted for inclusion in the Work
+ by You to the Licensor shall be under the terms and conditions of
+ this License, without any additional terms or conditions.
+ Notwithstanding the above, nothing herein shall supersede or modify
+ the terms of any separate license agreement you may have executed
+ with Licensor regarding such Contributions.
+
+ 6. Trademarks. This License does not grant permission to use the trade
+ names, trademarks, service marks, or product names of the Licensor,
+ except as required for reasonable and customary use in describing the
+ origin of the Work and reproducing the content of the NOTICE file.
+
+ 7. Disclaimer of Warranty. Unless required by applicable law or
+ agreed to in writing, Licensor provides the Work (and each
+ Contributor provides its Contributions) on an "AS IS" BASIS,
+ WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or
+ implied, including, without limitation, any warranties or conditions
+ of TITLE, NON-INFRINGEMENT, MERCHANTABILITY, or FITNESS FOR A
+ PARTICULAR PURPOSE. You are solely responsible for determining the
+ appropriateness of using or redistributing the Work and assume any
+ risks associated with Your exercise of permissions under this License.
+
+ 8. Limitation of Liability. In no event and under no legal theory,
+ whether in tort (including negligence), contract, or otherwise,
+ unless required by applicable law (such as deliberate and grossly
+ negligent acts) or agreed to in writing, shall any Contributor be
+ liable to You for damages, including any direct, indirect, special,
+ incidental, or consequential damages of any character arising as a
+ result of this License or out of the use or inability to use the
+ Work (including but not limited to damages for loss of goodwill,
+ work stoppage, computer failure or malfunction, or any and all
+ other commercial damages or losses), even if such Contributor
+ has been advised of the possibility of such damages.
+
+ 9. Accepting Warranty or Additional Liability. While redistributing
+ the Work or Derivative Works thereof, You may choose to offer,
+ and charge a fee for, acceptance of support, warranty, indemnity,
+ or other liability obligations and/or rights consistent with this
+ License. However, in accepting such obligations, You may act only
+ on Your own behalf and on Your sole responsibility, not on behalf
+ of any other Contributor, and only if You agree to indemnify,
+ defend, and hold each Contributor harmless for any liability
+ incurred by, or claims asserted against, such Contributor by reason
+ of your accepting any such warranty or additional liability.
+
+ END OF TERMS AND CONDITIONS
+
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/NOTICE.md b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/NOTICE.md
new file mode 100644
index 0000000..ef55b08
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/NOTICE.md
@@ -0,0 +1,6 @@
+This software is copyright 2026-present Prism ML, Inc. It is available under the Apache 2.0 license.
+If you publicly deploy or redistribute this software, we would appreciate attribution such as: "Created using Bonsai Image by Prism ML."
+
+This software is built from FLUX.2 [klein] 4B, Copyright 2026 Black Forest Labs, which is available under the Apache 2.0 License: https://huggingface.co/black-forest-labs/FLUX.2-klein-4B/blob/main/LICENSE.md
+
+The text encoder is built from Qwen3-4B, Copyright 2024 Alibaba Cloud, which is available under the Apache 2.0 License: https://huggingface.co/Qwen/Qwen3-4B/blob/main/LICENSE
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/README.md b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/README.md
new file mode 100644
index 0000000..b06739a
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/README.md
@@ -0,0 +1,213 @@
+---
+license: apache-2.0
+pipeline_tag: text-to-image
+tags:
+- ternary
+- 1.58-bit
+- mlx
+- apple-silicon
+- on-device
+- text-to-image
+- diffusion
+- flux
+- prismml
+- bonsai
+base_model:
+- prism-ml/bonsai-image-ternary-4B-unpacked
+---
+
+
+
+
+
+
+ Prism ML Website |
+ White Paper |
+ Demo & Examples |
+ Discord
+
+
+# bonsai-image-ternary-4B-mlx-2bit
+
+Ternary weight (1.58-bit) text-to-image diffusion transformer deployment for Apple Silicon
+
+> **1.21 GB transformer** | **6.4×** smaller than FP16 | **9.4 s / 512²** on iPhone 17 Pro Max | **~6 s / 512²** on M4 Pro | runs on Mac, iPhone, iPad
+
+## Highlights
+
+- **1.21 GB** diffusion transformer, down from **7.75 GB** for the FP16 FLUX.2 Klein 4B transformer
+- Ternary {−1, 0, +1} transformer weights with FP16 group-wise scaling in the matrix-heavy transformer layers (Q/K/V projections, output projections, MLP weights)
+- Quality-oriented Bonsai Image variant: the additional zero state improves visual quality and prompt fidelity while keeping the transformer compact
+- 3.88 GB Apple Silicon deployment payload including the 4-bit text encoder and FP16 VAE — text encoder is offloaded after prompt encode, so the denoising loop only keeps the compact transformer and VAE resident
+- 4-step FlowMatch-Euler sampler with guidance = 1.0 and shift = 3.0 — no CFG, no negative prompts needed
+- MLX-native 2-bit format for Apple Silicon, the same kernel path as our ternary language-model releases
+- Cross-platform companion: also available as [gemlite 2-bit](https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit) for NVIDIA GPUs
+
+## Resources
+
+- **[White Paper](https://github.com/PrismML-Eng/Bonsai-Image-Demo/blob/main/bonsai-image-4b-whitepaper.pdf)** — full benchmarks, kernels, and memory analysis
+- **[Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo)** — one-command setup for Mac / Linux / Windows
+- **[Discord](https://discord.gg/prismml)** — community + support
+- **Kernels**: [MLX](https://github.com/ml-explore/mlx) (Apple Silicon) · [mlx-swift](https://github.com/ml-explore/mlx-swift) (iOS / macOS) — 2-bit format is supported out of the box
+
+## Model Overview
+
+| Item | Specification |
+| :-------------------- | :-------------------------------------------------------------------------------------|
+| Base architecture | FLUX.2 Klein 4B (MMDiT diffusion transformer) |
+| Parameters | ~4.0B (transformer trunk) |
+| Blocks | 25 MMDiT blocks: 5 double-stream + 20 single-stream |
+| Sampler | FlowMatchEuler, **4 steps**, guidance = 1.0, shift = 3.0 |
+| Text encoder | Qwen3-4B at 4-bit (≈ 2.28 GB on-device, offloaded after prompt encode) |
+| VAE | Flux2 32-channel latent, tiled decode (128 px tiles) |
+| Native resolution | 1024×1024 (also supports 512×512 and arbitrary multiples of 32) |
+| Weight format | MLX 2-bit g128, ternary values + FP16 group-wise scales |
+| **Transformer size** | **1.21 GB** (6.4× smaller than 7.75 GB FP16) |
+| Total payload | **3.88 GB** (4.1x smaller than the 15.97 GB FP16 transformer + text encoder + VAE) |
+| Ternary coverage | All 100 matmul-heavy linears in the 25 MMDiT blocks |
+| License | Apache 2.0 |
+
+## Ternary Weight Representation: 1.58-bit g128
+
+Each ternary weight takes a value from {−1, 0, +1} with one shared FP16 scale per group of 128 weights:
+
+```
+w_i = scale_g * t_i, t_i in {−1, 0, +1}
+```
+
+Ternary values carry log₂(3) ≈ 1.585 bits of information per weight. With one FP16 scale per group of 128, the effective storage is
+
+```
+b_eff ≈ log2(3) + 16/128 ≈ 1.585 + 0.125 ≈ 1.71 bits/weight
+```
+
+This gives an idealized **9.4× reduction** relative to FP16 for the ternary transformer layers. A small set of precision-sensitive supporting tensors remains in FP16, so the final Ternary Bonsai Image 4B diffusion transformer is **1.21 GB**, a 6.4× reduction from the 7.75 GB FP16 FLUX.2 Klein 4B transformer.
+
+The ternary representation is applied to the matrix-heavy transformer layers, including Q / K / V projections, output projections, MLP linears, and the double-stream add-K / Q / V linears. Supporting tensors (less than 5% of the total parameters) such as modulation streams, embedders, output norm, and output projection remain FP16 for image quality and stability.
+
+The MLX deployment uses a 2-bit packed format. Ternary values are stored in 2-bit slots, with the fourth code unused. The model-level Bonsai representation is **1.21 GB**; the deployed MLX pack is **1.43 GB** on disk due to runtime packing and alignment overhead in the current MLX path.
+
+### Memory
+
+| Format | Transformer size | Reduction | Ratio |
+| :------------------------------ | ---------------: | --------: | -------: |
+| FP16 FLUX.2 Klein 4B | 7.75 GB | — | 1.0× |
+| **Ternary Bonsai Image 4B** | **1.21 GB** | **84.4%** | **6.4×** |
+
+Apple Silicon deployment:
+
+| Component | Size |
+| :------------------------------ | ------: |
+| MLX 2-bit diffusion transformer | 1.43 GB |
+| Compressed text encoder | 2.28 GB |
+| FP16 VAE | 0.17 GB |
+| **Total payload** | **3.88 GB** |
+
+At runtime, the text encoder is offloaded after prompt encoding. During denoising, the repeated image-generation loop is dominated by the compact ternary diffusion transformer and active image-generation components rather than the full payload.
+
+End-to-end Mac M4 Pro mean-active memory pressure at 1024² is **2.38 GB** — a **6.0×** reduction vs the stock FP16 MFLUX pipeline (14.39 GB).
+
+
+## Best Practices
+
+- Sampler: FlowMatchEuler-discrete with 4 steps, guidance = 1.0 (no classifier-free guidance), shift = 3.0. The model is designed for 4 steps; running more steps does not improve quality significantly and can introduce artifacts.
+- Resolution: native 1024² is the design target; 512² works for quick previews.
+- Aspect ratios: multiples of 32 are supported, including 832×1248 and 1248×832.
+- Prompting: natural-language prompts. Negative prompts are not required.
+- Runtime memory: the text encoder is offloaded after prompt encoding, so the denoising loop is memory-light.
+
+## Quickstart
+
+### MLX (Python)
+
+The simplest path is the [Bonsai Image Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo), which sets up the full Bonsai Studio (FastAPI backend + Next.js frontend):
+
+```bash
+git clone https://github.com/PrismML-Eng/Bonsai-Image-Demo.git
+cd Bonsai-Image-Demo
+./setup.sh
+./scripts/download_model.sh # ternary is the default
+./scripts/serve.sh
+```
+
+For a one-shot render without the studio frontend:
+
+```bash
+./scripts/generate.sh --prompt "A bonsai tree in a quiet ceramic studio, soft morning light"
+```
+
+### MLX Swift (iOS / macOS)
+
+Ternary Bonsai Image 4B runs natively on iPhone and iPad via MLX Swift. Bonsai Studio for iPhone is available on the App Store and ships ternary as the default variant.
+
+## Throughput (MLX / Apple Silicon)
+
+Mac M4 Pro (48 GB unified memory), 4 denoising steps, fixed prompt and seed:
+
+| Resolution | s / step | s / image (mean ± std) | vs stock MFLUX FP16 |
+| :------------ | -------: | ---------------------: | ------------------: |
+| 512 × 512 | 1.44 | 5.78 ± 0.08 s | **3.15×** |
+| 1024 × 1024 | 6.06 | **24.26 ± 0.24 s** | **5.56×** |
+
+iPhone 17 Pro Max (A19 Pro, 12 GB unified memory), MLX Swift, same methodology:
+
+| Resolution | s / step | s / image |
+| :------------ | -------: | --------: |
+| 128 × 128 | 0.68 | 2.7 s |
+| 256 × 256 | 1.00 | 4.0 s |
+| 512 × 512 | 2.35 | **9.4 s** |
+| 1024 × 1024 | 8.50 | **34.0 s**|
+
+Stock FP16 FLUX.2 Klein 4B does not fit within iPhone 17 Pro Max's 12 GB unified memory budget; Bonsai Image 4B models do.
+
+## Benchmarks
+
+Evaluated with matched generation settings across the comparison set on H100. GenEval uses the official 512x512 protocol. For HPSv3 and DPG-Bench, larger-backbone rows are evaluated at 1024x1024, while smaller-backbone rows are evaluated at their native 512x512 setting. Higher is better for all three benchmarks.
+
+| Model | Transformer (GB) | GenEval | HPSv3 | DPG-Bench |
+| :--------------------------- | ---------------: | ------: | -----: | --------: |
+| **Bonsai Image · Ternary 4B**| **1.21** | **0.723** | **12.22** | **0.851** |
+| **Bonsai Image · Binary 4B** | **0.93** | **0.671** | **11.15** | **0.822** |
+| FLUX.2 Klein 4B | 7.75 | 0.819 | 12.84 | 0.853 |
+| FLUX.1-schnell | 23.8 | 0.716 | 12.67 | 0.848 |
+| SDXL | 5.14 | 0.300 | 10.05 | 0.740 |
+| PixArt-Σ XL 2 | 1.20 | 0.541 | 11.93 | 0.769 |
+| Stable Diffusion 1.5 | 1.72 | 0.396 | 4.20 | 0.601 |
+| BK-SDM-Small | 0.98 | 0.297 | 3.05 | 0.559 |
+
+The benchmark results show the intended quality-footprint trade-off. Ternary Bonsai Image 4B is the quality-oriented variant: at 1.21 GB, it sits very close to FLUX.2 Klein 4B across GenEval, HPSv3, and DPG-Bench while reducing the diffusion transformer footprint by 6.4x. The binary companion is the footprint-oriented variant, reducing the diffusion transformer below 1 GB while still delivering strong benchmark results.
+
+Together, the Bonsai Image variants move the quality-footprint frontier: they bring modern diffusion-transformer behavior into a memory range previously occupied by much smaller, lower-capability models.
+
+## Use Cases
+
+- **Local creative tooling**: image generation directly on Mac, iPhone, and iPad
+- **Private generation**: prompts and generated assets can remain local
+- **Rapid iteration**: lower local latency and no remote queue for iterative creative workflows
+- **Mobile deployment**: image generation on devices with unified-memory, thermal, and connectivity constraints
+- **Commodity-GPU serving**: lower transformer footprint and reduced memory pressure through the companion CUDA deployment
+- **Enterprise and controlled inference**: local or private environments for data residency and compliance-sensitive workflows
+
+## Limitations
+
+- Ternary Bonsai Image 4B is not bit-identical to the FP16 FLUX.2 Klein 4B model; it is a compact ternary-weight deployment designed to deliver similar practical behavior at much smaller size.
+- Image-generation quality remains prompt- and workflow-dependent. Small text, fine details, object counts, and strict compositional constraints should be evaluated for the target use case.
+- Current commodity inference stacks do not yet expose fully native ternary execution as a standard hardware path. This release uses practical MLX low-bit kernel paths on Apple Silicon and Gemlite low-bit GEMM on CUDA.
+- After the diffusion transformer is made compact, other components such as the VAE can become more visible memory bottlenecks. The runtime mitigates this with text-encoder offload and tiled VAE decoding.
+
+
+## Citation
+
+```bibtex
+@techreport{bonsaiimage4b,
+ title = {Bonsai Image 4B: Low-Bit Diffusion on Apple Silicon and Consumer GPUs},
+ author = {Prism ML},
+ year = {2026},
+ month = {May},
+ url = {https://prismml.com}
+}
+```
+
+## Contact
+
+For questions, feedback, or collaboration inquiries: **contact@prismml.com**
\ No newline at end of file
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/assets/bonsai-logo.svg b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/assets/bonsai-logo.svg
new file mode 100644
index 0000000..2cfef2b
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/assets/bonsai-logo.svg
@@ -0,0 +1 @@
+
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/manifest.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/manifest.json
new file mode 100644
index 0000000..f4507c5
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/manifest.json
@@ -0,0 +1,136 @@
+{
+ "model_version": "ternary g128 (Apple Silicon mlx-2bit deployment)",
+ "total_bytes": 3888274639,
+ "files": [
+ {
+ "remote_path": "LICENSE",
+ "size": 10174,
+ "sha256": "69849221bfb90053de2134ef5e6d540287b4b98062326492f1f96f5da685524b"
+ },
+ {
+ "remote_path": "NOTICE.md",
+ "size": 623,
+ "sha256": "bbefa4a26b836efc040c1a0f155a425d1d833eae1b2534ffc414b1eada3cd922"
+ },
+ {
+ "remote_path": "README.md",
+ "size": 12443,
+ "sha256": "4017f9c74fc1f89212a8b736a29bcc742fe1fe4679fbeb1a5818bf395f80d55e"
+ },
+ {
+ "remote_path": "model_index.json",
+ "size": 81,
+ "sha256": "ecb4735e37691a8733f62957fd6c548f841af40624905bb24fa639756153c8a1"
+ },
+ {
+ "remote_path": "scheduler/scheduler_config.json",
+ "size": 486,
+ "sha256": "067afb012cef64553a763447d1efd93daeffcc0123ca7e25b09f8de20b90762e"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/added_tokens.json",
+ "size": 707,
+ "sha256": "c0284b582e14987fbd3d5a2cb2bd139084371ed9acbae488829a1c900833c680"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/config.json",
+ "size": 937,
+ "sha256": "b5efdcf3b0035a3638e7228dad4d85f5c4a23f156eb7cdb0b44c8366a5d34d9b"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/merges.txt",
+ "size": 1671853,
+ "sha256": "8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/model.safetensors",
+ "size": 2263022529,
+ "sha256": "e240c0bdc0ebb0681bf0da0f98d9719fd6ebe269a3633f81542c13e81345651d"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/model.safetensors.index.json",
+ "size": 63924,
+ "sha256": "f7825defe5865d179c3b593173d37056be5f202dcb7153985cf74e75ecf1628b"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/special_tokens_map.json",
+ "size": 613,
+ "sha256": "76862e765266b85aa9459767e33cbaf13970f327a0e88d1c65846c2ddd3a1ecd"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/tokenizer.json",
+ "size": 11422654,
+ "sha256": "aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/tokenizer_config.json",
+ "size": 9706,
+ "sha256": "253153d0738ceb4c668d2eff957714dd2bea0b56de772a9fdccd96cbf517e6a0"
+ },
+ {
+ "remote_path": "text_encoder-mlx-4bit/vocab.json",
+ "size": 2776833,
+ "sha256": "ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910"
+ },
+ {
+ "remote_path": "tokenizer/added_tokens.json",
+ "size": 707,
+ "sha256": "c0284b582e14987fbd3d5a2cb2bd139084371ed9acbae488829a1c900833c680"
+ },
+ {
+ "remote_path": "tokenizer/chat_template.jinja",
+ "size": 4168,
+ "sha256": "a55ee1b1660128b7098723e0abcd92caa0788061051c62d51cbe87d9cf1974d8"
+ },
+ {
+ "remote_path": "tokenizer/merges.txt",
+ "size": 1671853,
+ "sha256": "8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5"
+ },
+ {
+ "remote_path": "tokenizer/special_tokens_map.json",
+ "size": 613,
+ "sha256": "76862e765266b85aa9459767e33cbaf13970f327a0e88d1c65846c2ddd3a1ecd"
+ },
+ {
+ "remote_path": "tokenizer/tokenizer.json",
+ "size": 11422654,
+ "sha256": "aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4"
+ },
+ {
+ "remote_path": "tokenizer/tokenizer_config.json",
+ "size": 5404,
+ "sha256": "443bfa629eb16387a12edbf92a76f6a6f10b2af3b53d87ba1550adfcf45f7fa0"
+ },
+ {
+ "remote_path": "tokenizer/vocab.json",
+ "size": 2776833,
+ "sha256": "ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910"
+ },
+ {
+ "remote_path": "transformer-packed-mflux/config.json",
+ "size": 619,
+ "sha256": "14c6d8314d28cc027ce636d52dfb98cecc11b65c1455bd51b394a971f4b7b49e"
+ },
+ {
+ "remote_path": "transformer-packed-mflux/diffusion_pytorch_model.safetensors",
+ "size": 1425271472,
+ "sha256": "b21737bdf02690b7d662907781c4dc8b8bf22a2c98b823b1ca3336f48371a84f"
+ },
+ {
+ "remote_path": "transformer-packed-mflux/quantization_config.json",
+ "size": 5054,
+ "sha256": "6a792a07051e534b177aefaac5222796ec13bbdd1a597a2b08695b4c6c75fec7"
+ },
+ {
+ "remote_path": "vae/config.json",
+ "size": 821,
+ "sha256": "0d6dfb69ae95a5e2ac9836284bbb63d8b38ce67b25ba2dff380752b2a10ab948"
+ },
+ {
+ "remote_path": "vae/diffusion_pytorch_model.safetensors",
+ "size": 168120878,
+ "sha256": "ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04"
+ }
+ ]
+}
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/model_index.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/model_index.json
new file mode 100644
index 0000000..23fc542
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/model_index.json
@@ -0,0 +1,4 @@
+{
+ "_class_name": "Flux2KleinPipeline",
+ "_diffusers_version": "0.37.0.dev0"
+}
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/scheduler/scheduler_config.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/scheduler/scheduler_config.json
new file mode 100644
index 0000000..7e53605
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/scheduler/scheduler_config.json
@@ -0,0 +1,18 @@
+{
+ "_class_name": "FlowMatchEulerDiscreteScheduler",
+ "_diffusers_version": "0.37.0.dev0",
+ "base_image_seq_len": 256,
+ "base_shift": 0.5,
+ "invert_sigmas": false,
+ "max_image_seq_len": 4096,
+ "max_shift": 1.15,
+ "num_train_timesteps": 1000,
+ "shift": 3.0,
+ "shift_terminal": null,
+ "stochastic_sampling": false,
+ "time_shift_type": "exponential",
+ "use_beta_sigmas": false,
+ "use_dynamic_shifting": true,
+ "use_exponential_sigmas": false,
+ "use_karras_sigmas": false
+}
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/added_tokens.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/added_tokens.json
new file mode 100644
index 0000000..b54f913
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/added_tokens.json
@@ -0,0 +1,28 @@
+{
+ "": 151668,
+ " ": 151658,
+ "": 151666,
+ "": 151667,
+ "": 151657,
+ "": 151665,
+ "<|box_end|>": 151649,
+ "<|box_start|>": 151648,
+ "<|endoftext|>": 151643,
+ "<|file_sep|>": 151664,
+ "<|fim_middle|>": 151660,
+ "<|fim_pad|>": 151662,
+ "<|fim_prefix|>": 151659,
+ "<|fim_suffix|>": 151661,
+ "<|im_end|>": 151645,
+ "<|im_start|>": 151644,
+ "<|image_pad|>": 151655,
+ "<|object_ref_end|>": 151647,
+ "<|object_ref_start|>": 151646,
+ "<|quad_end|>": 151651,
+ "<|quad_start|>": 151650,
+ "<|repo_name|>": 151663,
+ "<|video_pad|>": 151656,
+ "<|vision_end|>": 151653,
+ "<|vision_pad|>": 151654,
+ "<|vision_start|>": 151652
+}
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/config.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/config.json
new file mode 100644
index 0000000..032ad32
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/config.json
@@ -0,0 +1,38 @@
+{
+ "architectures": [
+ "Qwen3ForCausalLM"
+ ],
+ "attention_bias": false,
+ "attention_dropout": 0.0,
+ "bos_token_id": 151643,
+ "eos_token_id": 151645,
+ "head_dim": 128,
+ "hidden_act": "silu",
+ "hidden_size": 2560,
+ "initializer_range": 0.02,
+ "intermediate_size": 9728,
+ "max_position_embeddings": 40960,
+ "max_window_layers": 36,
+ "model_type": "qwen3",
+ "num_attention_heads": 32,
+ "num_hidden_layers": 36,
+ "num_key_value_heads": 8,
+ "quantization": {
+ "group_size": 64,
+ "bits": 4
+ },
+ "quantization_config": {
+ "group_size": 64,
+ "bits": 4
+ },
+ "rms_norm_eps": 1e-06,
+ "rope_scaling": null,
+ "rope_theta": 1000000,
+ "sliding_window": null,
+ "tie_word_embeddings": true,
+ "torch_dtype": "bfloat16",
+ "transformers_version": "4.51.0",
+ "use_cache": true,
+ "use_sliding_window": false,
+ "vocab_size": 151936
+}
\ No newline at end of file
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/merges.txt b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/merges.txt
new file mode 100644
index 0000000..80c1a19
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/merges.txt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5
+size 1671853
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/model.safetensors b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/model.safetensors
new file mode 100644
index 0000000..bb9a979
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:e240c0bdc0ebb0681bf0da0f98d9719fd6ebe269a3633f81542c13e81345651d
+size 2263022529
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/model.safetensors.index.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/model.safetensors.index.json
new file mode 100644
index 0000000..07e230a
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/model.safetensors.index.json
@@ -0,0 +1,911 @@
+{
+ "metadata": {
+ "total_size": 2262920192
+ },
+ "weight_map": {
+ "model.embed_tokens.biases": "model.safetensors",
+ "model.embed_tokens.scales": "model.safetensors",
+ "model.embed_tokens.weight": "model.safetensors",
+ "model.layers.0.input_layernorm.weight": "model.safetensors",
+ "model.layers.0.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.0.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.0.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.0.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.0.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.0.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.0.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.0.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.0.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.0.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.0.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.0.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.0.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.0.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.0.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.0.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.0.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.0.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.0.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.0.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.0.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.0.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.0.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.0.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.1.input_layernorm.weight": "model.safetensors",
+ "model.layers.1.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.1.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.1.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.1.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.1.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.1.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.1.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.1.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.1.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.1.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.1.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.1.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.1.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.1.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.1.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.1.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.1.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.1.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.1.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.1.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.1.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.1.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.1.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.1.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.10.input_layernorm.weight": "model.safetensors",
+ "model.layers.10.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.10.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.10.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.10.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.10.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.10.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.10.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.10.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.10.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.10.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.10.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.10.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.10.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.10.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.10.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.10.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.10.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.10.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.10.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.10.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.10.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.10.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.10.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.10.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.11.input_layernorm.weight": "model.safetensors",
+ "model.layers.11.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.11.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.11.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.11.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.11.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.11.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.11.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.11.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.11.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.11.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.11.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.11.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.11.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.11.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.11.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.11.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.11.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.11.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.11.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.11.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.11.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.11.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.11.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.11.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.12.input_layernorm.weight": "model.safetensors",
+ "model.layers.12.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.12.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.12.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.12.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.12.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.12.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.12.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.12.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.12.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.12.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.12.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.12.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.12.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.12.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.12.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.12.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.12.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.12.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.12.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.12.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.12.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.12.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.12.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.12.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.13.input_layernorm.weight": "model.safetensors",
+ "model.layers.13.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.13.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.13.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.13.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.13.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.13.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.13.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.13.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.13.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.13.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.13.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.13.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.13.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.13.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.13.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.13.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.13.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.13.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.13.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.13.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.13.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.13.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.13.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.13.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.14.input_layernorm.weight": "model.safetensors",
+ "model.layers.14.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.14.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.14.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.14.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.14.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.14.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.14.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.14.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.14.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.14.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.14.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.14.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.14.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.14.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.14.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.14.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.14.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.14.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.14.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.14.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.14.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.14.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.14.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.14.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.15.input_layernorm.weight": "model.safetensors",
+ "model.layers.15.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.15.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.15.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.15.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.15.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.15.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.15.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.15.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.15.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.15.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.15.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.15.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.15.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.15.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.15.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.15.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.15.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.15.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.15.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.15.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.15.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.15.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.15.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.15.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.16.input_layernorm.weight": "model.safetensors",
+ "model.layers.16.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.16.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.16.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.16.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.16.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.16.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.16.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.16.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.16.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.16.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.16.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.16.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.16.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.16.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.16.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.16.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.16.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.16.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.16.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.16.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.16.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.16.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.16.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.16.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.17.input_layernorm.weight": "model.safetensors",
+ "model.layers.17.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.17.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.17.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.17.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.17.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.17.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.17.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.17.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.17.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.17.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.17.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.17.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.17.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.17.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.17.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.17.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.17.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.17.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.17.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.17.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.17.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.17.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.17.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.17.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.18.input_layernorm.weight": "model.safetensors",
+ "model.layers.18.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.18.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.18.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.18.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.18.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.18.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.18.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.18.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.18.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.18.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.18.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.18.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.18.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.18.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.18.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.18.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.18.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.18.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.18.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.18.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.18.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.18.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.18.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.18.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.19.input_layernorm.weight": "model.safetensors",
+ "model.layers.19.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.19.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.19.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.19.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.19.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.19.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.19.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.19.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.19.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.19.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.19.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.19.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.19.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.19.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.19.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.19.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.19.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.19.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.19.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.19.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.19.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.19.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.19.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.19.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.2.input_layernorm.weight": "model.safetensors",
+ "model.layers.2.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.2.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.2.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.2.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.2.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.2.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.2.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.2.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.2.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.2.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.2.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.2.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.2.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.2.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.2.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.2.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.2.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.2.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.2.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.2.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.2.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.2.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.2.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.2.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.20.input_layernorm.weight": "model.safetensors",
+ "model.layers.20.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.20.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.20.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.20.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.20.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.20.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.20.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.20.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.20.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.20.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.20.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.20.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.20.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.20.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.20.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.20.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.20.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.20.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.20.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.20.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.20.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.20.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.20.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.20.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.21.input_layernorm.weight": "model.safetensors",
+ "model.layers.21.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.21.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.21.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.21.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.21.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.21.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.21.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.21.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.21.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.21.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.21.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.21.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.21.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.21.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.21.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.21.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.21.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.21.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.21.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.21.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.21.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.21.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.21.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.21.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.22.input_layernorm.weight": "model.safetensors",
+ "model.layers.22.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.22.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.22.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.22.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.22.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.22.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.22.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.22.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.22.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.22.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.22.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.22.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.22.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.22.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.22.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.22.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.22.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.22.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.22.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.22.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.22.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.22.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.22.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.22.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.23.input_layernorm.weight": "model.safetensors",
+ "model.layers.23.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.23.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.23.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.23.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.23.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.23.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.23.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.23.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.23.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.23.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.23.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.23.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.23.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.23.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.23.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.23.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.23.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.23.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.23.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.23.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.23.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.23.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.23.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.23.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.24.input_layernorm.weight": "model.safetensors",
+ "model.layers.24.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.24.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.24.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.24.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.24.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.24.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.24.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.24.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.24.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.24.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.24.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.24.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.24.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.24.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.24.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.24.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.24.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.24.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.24.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.24.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.24.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.24.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.24.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.24.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.25.input_layernorm.weight": "model.safetensors",
+ "model.layers.25.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.25.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.25.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.25.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.25.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.25.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.25.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.25.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.25.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.25.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.25.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.25.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.25.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.25.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.25.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.25.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.25.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.25.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.25.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.25.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.25.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.25.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.25.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.25.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.26.input_layernorm.weight": "model.safetensors",
+ "model.layers.26.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.26.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.26.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.26.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.26.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.26.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.26.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.26.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.26.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.26.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.26.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.26.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.26.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.26.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.26.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.26.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.26.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.26.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.26.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.26.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.26.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.26.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.26.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.26.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.27.input_layernorm.weight": "model.safetensors",
+ "model.layers.27.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.27.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.27.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.27.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.27.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.27.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.27.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.27.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.27.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.27.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.27.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.27.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.27.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.27.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.27.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.27.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.27.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.27.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.27.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.27.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.27.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.27.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.27.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.27.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.28.input_layernorm.weight": "model.safetensors",
+ "model.layers.28.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.28.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.28.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.28.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.28.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.28.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.28.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.28.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.28.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.28.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.28.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.28.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.28.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.28.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.28.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.28.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.28.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.28.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.28.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.28.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.28.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.28.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.28.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.28.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.29.input_layernorm.weight": "model.safetensors",
+ "model.layers.29.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.29.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.29.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.29.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.29.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.29.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.29.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.29.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.29.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.29.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.29.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.29.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.29.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.29.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.29.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.29.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.29.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.29.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.29.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.29.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.29.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.29.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.29.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.29.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.3.input_layernorm.weight": "model.safetensors",
+ "model.layers.3.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.3.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.3.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.3.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.3.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.3.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.3.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.3.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.3.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.3.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.3.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.3.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.3.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.3.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.3.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.3.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.3.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.3.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.3.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.3.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.3.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.3.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.3.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.3.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.30.input_layernorm.weight": "model.safetensors",
+ "model.layers.30.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.30.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.30.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.30.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.30.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.30.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.30.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.30.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.30.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.30.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.30.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.30.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.30.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.30.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.30.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.30.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.30.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.30.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.30.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.30.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.30.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.30.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.30.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.30.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.31.input_layernorm.weight": "model.safetensors",
+ "model.layers.31.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.31.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.31.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.31.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.31.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.31.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.31.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.31.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.31.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.31.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.31.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.31.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.31.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.31.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.31.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.31.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.31.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.31.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.31.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.31.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.31.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.31.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.31.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.31.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.32.input_layernorm.weight": "model.safetensors",
+ "model.layers.32.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.32.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.32.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.32.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.32.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.32.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.32.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.32.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.32.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.32.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.32.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.32.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.32.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.32.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.32.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.32.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.32.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.32.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.32.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.32.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.32.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.32.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.32.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.32.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.33.input_layernorm.weight": "model.safetensors",
+ "model.layers.33.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.33.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.33.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.33.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.33.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.33.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.33.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.33.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.33.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.33.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.33.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.33.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.33.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.33.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.33.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.33.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.33.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.33.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.33.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.33.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.33.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.33.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.33.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.33.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.34.input_layernorm.weight": "model.safetensors",
+ "model.layers.34.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.34.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.34.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.34.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.34.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.34.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.34.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.34.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.34.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.34.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.34.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.34.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.34.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.34.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.34.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.34.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.34.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.34.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.34.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.34.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.34.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.34.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.34.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.34.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.35.input_layernorm.weight": "model.safetensors",
+ "model.layers.35.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.35.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.35.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.35.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.35.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.35.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.35.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.35.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.35.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.35.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.35.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.35.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.35.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.35.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.35.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.35.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.35.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.35.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.35.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.35.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.35.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.35.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.35.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.35.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.4.input_layernorm.weight": "model.safetensors",
+ "model.layers.4.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.4.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.4.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.4.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.4.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.4.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.4.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.4.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.4.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.4.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.4.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.4.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.4.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.4.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.4.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.4.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.4.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.4.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.4.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.4.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.4.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.4.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.4.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.4.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.5.input_layernorm.weight": "model.safetensors",
+ "model.layers.5.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.5.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.5.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.5.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.5.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.5.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.5.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.5.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.5.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.5.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.5.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.5.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.5.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.5.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.5.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.5.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.5.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.5.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.5.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.5.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.5.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.5.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.5.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.5.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.6.input_layernorm.weight": "model.safetensors",
+ "model.layers.6.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.6.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.6.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.6.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.6.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.6.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.6.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.6.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.6.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.6.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.6.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.6.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.6.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.6.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.6.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.6.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.6.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.6.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.6.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.6.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.6.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.6.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.6.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.6.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.7.input_layernorm.weight": "model.safetensors",
+ "model.layers.7.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.7.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.7.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.7.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.7.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.7.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.7.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.7.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.7.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.7.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.7.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.7.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.7.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.7.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.7.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.7.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.7.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.7.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.7.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.7.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.7.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.7.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.7.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.7.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.8.input_layernorm.weight": "model.safetensors",
+ "model.layers.8.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.8.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.8.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.8.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.8.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.8.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.8.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.8.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.8.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.8.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.8.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.8.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.8.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.8.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.8.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.8.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.8.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.8.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.8.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.8.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.8.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.8.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.8.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.8.self_attn.v_proj.weight": "model.safetensors",
+ "model.layers.9.input_layernorm.weight": "model.safetensors",
+ "model.layers.9.mlp.down_proj.biases": "model.safetensors",
+ "model.layers.9.mlp.down_proj.scales": "model.safetensors",
+ "model.layers.9.mlp.down_proj.weight": "model.safetensors",
+ "model.layers.9.mlp.gate_proj.biases": "model.safetensors",
+ "model.layers.9.mlp.gate_proj.scales": "model.safetensors",
+ "model.layers.9.mlp.gate_proj.weight": "model.safetensors",
+ "model.layers.9.mlp.up_proj.biases": "model.safetensors",
+ "model.layers.9.mlp.up_proj.scales": "model.safetensors",
+ "model.layers.9.mlp.up_proj.weight": "model.safetensors",
+ "model.layers.9.post_attention_layernorm.weight": "model.safetensors",
+ "model.layers.9.self_attn.k_norm.weight": "model.safetensors",
+ "model.layers.9.self_attn.k_proj.biases": "model.safetensors",
+ "model.layers.9.self_attn.k_proj.scales": "model.safetensors",
+ "model.layers.9.self_attn.k_proj.weight": "model.safetensors",
+ "model.layers.9.self_attn.o_proj.biases": "model.safetensors",
+ "model.layers.9.self_attn.o_proj.scales": "model.safetensors",
+ "model.layers.9.self_attn.o_proj.weight": "model.safetensors",
+ "model.layers.9.self_attn.q_norm.weight": "model.safetensors",
+ "model.layers.9.self_attn.q_proj.biases": "model.safetensors",
+ "model.layers.9.self_attn.q_proj.scales": "model.safetensors",
+ "model.layers.9.self_attn.q_proj.weight": "model.safetensors",
+ "model.layers.9.self_attn.v_proj.biases": "model.safetensors",
+ "model.layers.9.self_attn.v_proj.scales": "model.safetensors",
+ "model.layers.9.self_attn.v_proj.weight": "model.safetensors",
+ "model.norm.weight": "model.safetensors"
+ }
+}
\ No newline at end of file
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/special_tokens_map.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/special_tokens_map.json
new file mode 100644
index 0000000..ac23c0a
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/special_tokens_map.json
@@ -0,0 +1,31 @@
+{
+ "additional_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "eos_token": {
+ "content": "<|im_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "pad_token": {
+ "content": "<|endoftext|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ }
+}
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/tokenizer.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/tokenizer.json
new file mode 100644
index 0000000..cd71f61
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4
+size 11422654
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/tokenizer_config.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/tokenizer_config.json
new file mode 100644
index 0000000..7345216
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/tokenizer_config.json
@@ -0,0 +1,240 @@
+{
+ "add_bos_token": false,
+ "add_prefix_space": false,
+ "added_tokens_decoder": {
+ "151643": {
+ "content": "<|endoftext|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151644": {
+ "content": "<|im_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151645": {
+ "content": "<|im_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151646": {
+ "content": "<|object_ref_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151647": {
+ "content": "<|object_ref_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151648": {
+ "content": "<|box_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151649": {
+ "content": "<|box_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151650": {
+ "content": "<|quad_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151651": {
+ "content": "<|quad_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151652": {
+ "content": "<|vision_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151653": {
+ "content": "<|vision_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151654": {
+ "content": "<|vision_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151655": {
+ "content": "<|image_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151656": {
+ "content": "<|video_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151657": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151658": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151659": {
+ "content": "<|fim_prefix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151660": {
+ "content": "<|fim_middle|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151661": {
+ "content": "<|fim_suffix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151662": {
+ "content": "<|fim_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151663": {
+ "content": "<|repo_name|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151664": {
+ "content": "<|file_sep|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151665": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151666": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151667": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151668": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ }
+ },
+ "additional_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "bos_token": null,
+ "chat_template": "{%- if tools %}\n {{- '<|im_start|>system\\n' }}\n {%- if messages[0].role == 'system' %}\n {{- messages[0].content + '\\n\\n' }}\n {%- endif %}\n {{- \"# Tools\\n\\nYou may call one or more functions to assist with the user query.\\n\\nYou are provided with function signatures within XML tags:\\n\" }}\n {%- for tool in tools %}\n {{- \"\\n\" }}\n {{- tool | tojson }}\n {%- endfor %}\n {{- \"\\n \\n\\nFor each function call, return a json object with function name and arguments within XML tags:\\n\\n{\\\"name\\\": , \\\"arguments\\\": }\\n <|im_end|>\\n\" }}\n{%- else %}\n {%- if messages[0].role == 'system' %}\n {{- '<|im_start|>system\\n' + messages[0].content + '<|im_end|>\\n' }}\n {%- endif %}\n{%- endif %}\n{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}\n{%- for message in messages[::-1] %}\n {%- set index = (messages|length - 1) - loop.index0 %}\n {%- if ns.multi_step_tool and message.role == \"user\" and not(message.content.startswith('') and message.content.endswith(' ')) %}\n {%- set ns.multi_step_tool = false %}\n {%- set ns.last_query_index = index %}\n {%- endif %}\n{%- endfor %}\n{%- for message in messages %}\n {%- if (message.role == \"user\") or (message.role == \"system\" and not loop.first) %}\n {{- '<|im_start|>' + message.role + '\\n' + message.content + '<|im_end|>' + '\\n' }}\n {%- elif message.role == \"assistant\" %}\n {%- set content = message.content %}\n {%- set reasoning_content = '' %}\n {%- if message.reasoning_content is defined and message.reasoning_content is not none %}\n {%- set reasoning_content = message.reasoning_content %}\n {%- else %}\n {%- if ' ' in message.content %}\n {%- set content = message.content.split('')[-1].lstrip('\\n') %}\n {%- set reasoning_content = message.content.split('')[0].rstrip('\\n').split('')[-1].lstrip('\\n') %}\n {%- endif %}\n {%- endif %}\n {%- if loop.index0 > ns.last_query_index %}\n {%- if loop.last or (not loop.last and reasoning_content) %}\n {{- '<|im_start|>' + message.role + '\\n\\n' + reasoning_content.strip('\\n') + '\\n \\n\\n' + content.lstrip('\\n') }}\n {%- else %}\n {{- '<|im_start|>' + message.role + '\\n' + content }}\n {%- endif %}\n {%- else %}\n {{- '<|im_start|>' + message.role + '\\n' + content }}\n {%- endif %}\n {%- if message.tool_calls %}\n {%- for tool_call in message.tool_calls %}\n {%- if (loop.first and content) or (not loop.first) %}\n {{- '\\n' }}\n {%- endif %}\n {%- if tool_call.function %}\n {%- set tool_call = tool_call.function %}\n {%- endif %}\n {{- '\\n{\"name\": \"' }}\n {{- tool_call.name }}\n {{- '\", \"arguments\": ' }}\n {%- if tool_call.arguments is string %}\n {{- tool_call.arguments }}\n {%- else %}\n {{- tool_call.arguments | tojson }}\n {%- endif %}\n {{- '}\\n ' }}\n {%- endfor %}\n {%- endif %}\n {{- '<|im_end|>\\n' }}\n {%- elif message.role == \"tool\" %}\n {%- if loop.first or (messages[loop.index0 - 1].role != \"tool\") %}\n {{- '<|im_start|>user' }}\n {%- endif %}\n {{- '\\n\\n' }}\n {{- message.content }}\n {{- '\\n ' }}\n {%- if loop.last or (messages[loop.index0 + 1].role != \"tool\") %}\n {{- '<|im_end|>\\n' }}\n {%- endif %}\n {%- endif %}\n{%- endfor %}\n{%- if add_generation_prompt %}\n {{- '<|im_start|>assistant\\n' }}\n {%- if enable_thinking is defined and enable_thinking is false %}\n {{- '\\n\\n \\n\\n' }}\n {%- endif %}\n{%- endif %}",
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": {},
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/vocab.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/vocab.json
new file mode 100644
index 0000000..6c49fc6
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/vocab.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910
+size 2776833
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/added_tokens.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/added_tokens.json
new file mode 100644
index 0000000..b54f913
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/added_tokens.json
@@ -0,0 +1,28 @@
+{
+ " ": 151668,
+ " ": 151658,
+ "": 151666,
+ "": 151667,
+ "": 151657,
+ "": 151665,
+ "<|box_end|>": 151649,
+ "<|box_start|>": 151648,
+ "<|endoftext|>": 151643,
+ "<|file_sep|>": 151664,
+ "<|fim_middle|>": 151660,
+ "<|fim_pad|>": 151662,
+ "<|fim_prefix|>": 151659,
+ "<|fim_suffix|>": 151661,
+ "<|im_end|>": 151645,
+ "<|im_start|>": 151644,
+ "<|image_pad|>": 151655,
+ "<|object_ref_end|>": 151647,
+ "<|object_ref_start|>": 151646,
+ "<|quad_end|>": 151651,
+ "<|quad_start|>": 151650,
+ "<|repo_name|>": 151663,
+ "<|video_pad|>": 151656,
+ "<|vision_end|>": 151653,
+ "<|vision_pad|>": 151654,
+ "<|vision_start|>": 151652
+}
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/chat_template.jinja b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/chat_template.jinja
new file mode 100644
index 0000000..01be9b3
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/chat_template.jinja
@@ -0,0 +1,89 @@
+{%- if tools %}
+ {{- '<|im_start|>system\n' }}
+ {%- if messages[0].role == 'system' %}
+ {{- messages[0].content + '\n\n' }}
+ {%- endif %}
+ {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n \n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n <|im_end|>\n" }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith(' ')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+{%- endfor %}
+{%- for message in messages %}
+ {%- if message.content is string %}
+ {%- set content = message.content %}
+ {%- else %}
+ {%- set content = '' %}
+ {%- endif %}
+ {%- if (message.role == "user") or (message.role == "system" and not loop.first) %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if ' ' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split(' ')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {%- if loop.last or (not loop.last and reasoning_content) %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n \n\n' + content.lstrip('\n') }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if (loop.first and content) or (not loop.first) %}
+ {{- '\n' }}
+ {%- endif %}
+ {%- if tool_call.function %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {{- '\n{"name": "' }}
+ {{- tool_call.name }}
+ {{- '", "arguments": ' }}
+ {%- if tool_call.arguments is string %}
+ {{- tool_call.arguments }}
+ {%- else %}
+ {{- tool_call.arguments | tojson }}
+ {%- endif %}
+ {{- '}\n ' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n ' }}
+ {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n \n\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/merges.txt b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/merges.txt
new file mode 100644
index 0000000..80c1a19
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/merges.txt
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5
+size 1671853
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/special_tokens_map.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/special_tokens_map.json
new file mode 100644
index 0000000..ac23c0a
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/special_tokens_map.json
@@ -0,0 +1,31 @@
+{
+ "additional_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "eos_token": {
+ "content": "<|im_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ },
+ "pad_token": {
+ "content": "<|endoftext|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false
+ }
+}
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/tokenizer.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/tokenizer.json
new file mode 100644
index 0000000..cd71f61
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/tokenizer.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4
+size 11422654
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/tokenizer_config.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/tokenizer_config.json
new file mode 100644
index 0000000..ddaf698
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/tokenizer_config.json
@@ -0,0 +1,239 @@
+{
+ "add_bos_token": false,
+ "add_prefix_space": false,
+ "added_tokens_decoder": {
+ "151643": {
+ "content": "<|endoftext|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151644": {
+ "content": "<|im_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151645": {
+ "content": "<|im_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151646": {
+ "content": "<|object_ref_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151647": {
+ "content": "<|object_ref_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151648": {
+ "content": "<|box_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151649": {
+ "content": "<|box_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151650": {
+ "content": "<|quad_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151651": {
+ "content": "<|quad_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151652": {
+ "content": "<|vision_start|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151653": {
+ "content": "<|vision_end|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151654": {
+ "content": "<|vision_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151655": {
+ "content": "<|image_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151656": {
+ "content": "<|video_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": true
+ },
+ "151657": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151658": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151659": {
+ "content": "<|fim_prefix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151660": {
+ "content": "<|fim_middle|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151661": {
+ "content": "<|fim_suffix|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151662": {
+ "content": "<|fim_pad|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151663": {
+ "content": "<|repo_name|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151664": {
+ "content": "<|file_sep|>",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151665": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151666": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151667": {
+ "content": "",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ },
+ "151668": {
+ "content": " ",
+ "lstrip": false,
+ "normalized": false,
+ "rstrip": false,
+ "single_word": false,
+ "special": false
+ }
+ },
+ "additional_special_tokens": [
+ "<|im_start|>",
+ "<|im_end|>",
+ "<|object_ref_start|>",
+ "<|object_ref_end|>",
+ "<|box_start|>",
+ "<|box_end|>",
+ "<|quad_start|>",
+ "<|quad_end|>",
+ "<|vision_start|>",
+ "<|vision_end|>",
+ "<|vision_pad|>",
+ "<|image_pad|>",
+ "<|video_pad|>"
+ ],
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|im_end|>",
+ "errors": "replace",
+ "extra_special_tokens": {},
+ "model_max_length": 131072,
+ "pad_token": "<|endoftext|>",
+ "split_special_tokens": false,
+ "tokenizer_class": "Qwen2Tokenizer",
+ "unk_token": null
+}
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/vocab.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/vocab.json
new file mode 100644
index 0000000..6c49fc6
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/vocab.json
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910
+size 2776833
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/config.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/config.json
new file mode 100644
index 0000000..b8badc8
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/config.json
@@ -0,0 +1,27 @@
+{
+ "_class_name": "Flux2Transformer2DModel",
+ "_diffusers_version": "0.37.1",
+ "_name_or_path": "black-forest-labs/FLUX.2-klein-4B",
+ "attention_head_dim": 128,
+ "axes_dims_rope": [
+ 32,
+ 32,
+ 32,
+ 32
+ ],
+ "enable_time_sign_embed": false,
+ "eps": 1e-06,
+ "guidance_embeds": false,
+ "in_channels": 128,
+ "joint_attention_dim": 7680,
+ "mlp_ratio": 3.0,
+ "musubi_block_swap_device": "cpu",
+ "musubi_blocks_to_swap": 0,
+ "num_attention_heads": 24,
+ "num_layers": 5,
+ "num_single_layers": 20,
+ "out_channels": null,
+ "patch_size": 1,
+ "rope_theta": 2000,
+ "timestep_guidance_channels": 256
+}
\ No newline at end of file
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/diffusion_pytorch_model.safetensors b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/diffusion_pytorch_model.safetensors
new file mode 100644
index 0000000..013b275
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/diffusion_pytorch_model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:b21737bdf02690b7d662907781c4dc8b8bf22a2c98b823b1ca3336f48371a84f
+size 1425271472
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/quantization_config.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/quantization_config.json
new file mode 100644
index 0000000..07ffa32
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/quantization_config.json
@@ -0,0 +1,120 @@
+{
+ "format": "mlx-packed-affine",
+ "solver": "ternary",
+ "bits": 2,
+ "group_size": 128,
+ "scale_dtype": "bfloat16",
+ "skip_patterns": [
+ "proj_out",
+ "x_embedder",
+ "context_embedder",
+ "time_text_embed",
+ "time_guidance_embed",
+ "norm_out",
+ "double_stream_modulation_img",
+ "double_stream_modulation_txt",
+ "single_stream_modulation"
+ ],
+ "quantized_modules": [
+ "single_transformer_blocks.0.attn.to_out",
+ "single_transformer_blocks.0.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.1.attn.to_out",
+ "single_transformer_blocks.1.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.10.attn.to_out",
+ "single_transformer_blocks.10.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.11.attn.to_out",
+ "single_transformer_blocks.11.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.12.attn.to_out",
+ "single_transformer_blocks.12.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.13.attn.to_out",
+ "single_transformer_blocks.13.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.14.attn.to_out",
+ "single_transformer_blocks.14.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.15.attn.to_out",
+ "single_transformer_blocks.15.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.16.attn.to_out",
+ "single_transformer_blocks.16.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.17.attn.to_out",
+ "single_transformer_blocks.17.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.18.attn.to_out",
+ "single_transformer_blocks.18.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.19.attn.to_out",
+ "single_transformer_blocks.19.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.2.attn.to_out",
+ "single_transformer_blocks.2.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.3.attn.to_out",
+ "single_transformer_blocks.3.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.4.attn.to_out",
+ "single_transformer_blocks.4.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.5.attn.to_out",
+ "single_transformer_blocks.5.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.6.attn.to_out",
+ "single_transformer_blocks.6.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.7.attn.to_out",
+ "single_transformer_blocks.7.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.8.attn.to_out",
+ "single_transformer_blocks.8.attn.to_qkv_mlp_proj",
+ "single_transformer_blocks.9.attn.to_out",
+ "single_transformer_blocks.9.attn.to_qkv_mlp_proj",
+ "transformer_blocks.0.attn.add_k_proj",
+ "transformer_blocks.0.attn.add_q_proj",
+ "transformer_blocks.0.attn.add_v_proj",
+ "transformer_blocks.0.attn.to_add_out",
+ "transformer_blocks.0.attn.to_k",
+ "transformer_blocks.0.attn.to_out.0",
+ "transformer_blocks.0.attn.to_q",
+ "transformer_blocks.0.attn.to_v",
+ "transformer_blocks.0.ff.linear_in",
+ "transformer_blocks.0.ff.linear_out",
+ "transformer_blocks.0.ff_context.linear_in",
+ "transformer_blocks.0.ff_context.linear_out",
+ "transformer_blocks.1.attn.add_k_proj",
+ "transformer_blocks.1.attn.add_q_proj",
+ "transformer_blocks.1.attn.add_v_proj",
+ "transformer_blocks.1.attn.to_add_out",
+ "transformer_blocks.1.attn.to_k",
+ "transformer_blocks.1.attn.to_out.0",
+ "transformer_blocks.1.attn.to_q",
+ "transformer_blocks.1.attn.to_v",
+ "transformer_blocks.1.ff.linear_in",
+ "transformer_blocks.1.ff.linear_out",
+ "transformer_blocks.1.ff_context.linear_in",
+ "transformer_blocks.1.ff_context.linear_out",
+ "transformer_blocks.2.attn.add_k_proj",
+ "transformer_blocks.2.attn.add_q_proj",
+ "transformer_blocks.2.attn.add_v_proj",
+ "transformer_blocks.2.attn.to_add_out",
+ "transformer_blocks.2.attn.to_k",
+ "transformer_blocks.2.attn.to_out.0",
+ "transformer_blocks.2.attn.to_q",
+ "transformer_blocks.2.attn.to_v",
+ "transformer_blocks.2.ff.linear_in",
+ "transformer_blocks.2.ff.linear_out",
+ "transformer_blocks.2.ff_context.linear_in",
+ "transformer_blocks.2.ff_context.linear_out",
+ "transformer_blocks.3.attn.add_k_proj",
+ "transformer_blocks.3.attn.add_q_proj",
+ "transformer_blocks.3.attn.add_v_proj",
+ "transformer_blocks.3.attn.to_add_out",
+ "transformer_blocks.3.attn.to_k",
+ "transformer_blocks.3.attn.to_out.0",
+ "transformer_blocks.3.attn.to_q",
+ "transformer_blocks.3.attn.to_v",
+ "transformer_blocks.3.ff.linear_in",
+ "transformer_blocks.3.ff.linear_out",
+ "transformer_blocks.3.ff_context.linear_in",
+ "transformer_blocks.3.ff_context.linear_out",
+ "transformer_blocks.4.attn.add_k_proj",
+ "transformer_blocks.4.attn.add_q_proj",
+ "transformer_blocks.4.attn.add_v_proj",
+ "transformer_blocks.4.attn.to_add_out",
+ "transformer_blocks.4.attn.to_k",
+ "transformer_blocks.4.attn.to_out.0",
+ "transformer_blocks.4.attn.to_q",
+ "transformer_blocks.4.attn.to_v",
+ "transformer_blocks.4.ff.linear_in",
+ "transformer_blocks.4.ff.linear_out",
+ "transformer_blocks.4.ff_context.linear_in",
+ "transformer_blocks.4.ff_context.linear_out"
+ ]
+}
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/vae/config.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/vae/config.json
new file mode 100644
index 0000000..c3f38eb
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/vae/config.json
@@ -0,0 +1,40 @@
+{
+ "_class_name": "AutoencoderKLFlux2",
+ "_diffusers_version": "0.37.0.dev0",
+ "_name_or_path": "black-forest-labs/FLUX.2-dev",
+ "act_fn": "silu",
+ "batch_norm_eps": 0.0001,
+ "batch_norm_momentum": 0.1,
+ "block_out_channels": [
+ 128,
+ 256,
+ 512,
+ 512
+ ],
+ "down_block_types": [
+ "DownEncoderBlock2D",
+ "DownEncoderBlock2D",
+ "DownEncoderBlock2D",
+ "DownEncoderBlock2D"
+ ],
+ "force_upcast": true,
+ "in_channels": 3,
+ "latent_channels": 32,
+ "layers_per_block": 2,
+ "mid_block_add_attention": true,
+ "norm_num_groups": 32,
+ "out_channels": 3,
+ "patch_size": [
+ 2,
+ 2
+ ],
+ "sample_size": 1024,
+ "up_block_types": [
+ "UpDecoderBlock2D",
+ "UpDecoderBlock2D",
+ "UpDecoderBlock2D",
+ "UpDecoderBlock2D"
+ ],
+ "use_post_quant_conv": true,
+ "use_quant_conv": true
+}
diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/vae/diffusion_pytorch_model.safetensors b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/vae/diffusion_pytorch_model.safetensors
new file mode 100644
index 0000000..0654e17
--- /dev/null
+++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/vae/diffusion_pytorch_model.safetensors
@@ -0,0 +1,3 @@
+version https://git-lfs.github.com/spec/v1
+oid sha256:ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04
+size 168120878