Upload folder using huggingface_hub

Browse files

Files changed (10) hide show

README.md +26 -3
config.json +15 -29
mergekit_config.yml +1 -1
model-00001-of-00003.safetensors +2 -2
model-00002-of-00003.safetensors +2 -2
model.safetensors.index.json +1 -1
special_tokens_map.json +3 -7
tokenizer.json +2 -2
tokenizer.model +2 -2
tokenizer_config.json +11 -39

README.md CHANGED Viewed

@@ -17,15 +17,38 @@ Gemma-TinyLLama-Passthrough is a merge of the following models using [mergekit](
 ## 🧩 Configuration
 \```yaml
 slices:
   - sources:
     - model: unsloth/gemma-2b-bnb-4bit
       layer_range: [0, 16]
   - sources:
     - model: TinyLlama/TinyLlama-1.1B-Chat-v1.0
-      layer_range: [6, 22]
 merge_method: passthrough
 dtype: bfloat16
 \```

 ## 🧩 Configuration
 \```yaml
+# models:
+#   - model: unsloth/gemma-7b-bnb-4bit
+#     layer_range: [0, 32]
+#     # no parameters necessary for base model
+#   - model: mistralai/Mistral-7B-v0.1
+#     layer_range: [24, 32]
+# merge_method: passthrough
+# # base_model: unsloth/gemma-7b-bnb-4bit
+# parameters:
+#   normalize: true
+#   int8_mask: true
+# dtype: float16
 slices:
   - sources:
     - model: unsloth/gemma-2b-bnb-4bit
       layer_range: [0, 16]
   - sources:
     - model: TinyLlama/TinyLlama-1.1B-Chat-v1.0
+      layer_range: [0, 22]
 merge_method: passthrough
 dtype: bfloat16
+# models:
+#   - model: unsloth/gemma-2b-bnb-4bit
+#     parameters:
+#       density: 0.53
+#       weight: 0.45
+#   - model: TinyLlama/TinyLlama-1.1B-Chat-v1.0
+#     parameters:
+#       weight: 0.5
+# merge_method: ties
+# base_model: unsloth/gemma-2b-bnb-4bit
+# parameters:
+#   int8_mask: true
+# dtype: bfloat16
 \```

config.json CHANGED Viewed

@@ -1,42 +1,28 @@
 {
-  "_name_or_path": "unsloth/gemma-2b-bnb-4bit",
   "architectures": [
-    "GemmaForCausalLM"
   ],
   "attention_bias": false,
   "attention_dropout": 0.0,
-  "bos_token_id": 2,
-  "eos_token_id": 1,
-  "head_dim": 256,
-  "hidden_act": "gelu",
   "hidden_size": 2048,
   "initializer_range": 0.02,
-  "intermediate_size": 16384,
-  "max_position_embeddings": 8192,
-  "model_type": "gemma",
-  "num_attention_heads": 8,
-  "num_hidden_layers": 32,
-  "num_key_value_heads": 1,
-  "pad_token_id": 0,
-  "quantization_config": {
-    "_load_in_4bit": true,
-    "_load_in_8bit": false,
-    "bnb_4bit_compute_dtype": "bfloat16",
-    "bnb_4bit_quant_type": "nf4",
-    "bnb_4bit_use_double_quant": true,
-    "llm_int8_enable_fp32_cpu_offload": false,
-    "llm_int8_has_fp16_weight": false,
-    "llm_int8_skip_modules": null,
-    "llm_int8_threshold": 6.0,
-    "load_in_4bit": true,
-    "load_in_8bit": false,
-    "quant_method": "bitsandbytes"
-  },
-  "rms_norm_eps": 1e-06,
   "rope_scaling": null,
   "rope_theta": 10000.0,
   "torch_dtype": "bfloat16",
   "transformers_version": "4.38.2",
   "use_cache": true,
-  "vocab_size": 256000
 }

 {
+  "_name_or_path": "TinyLlama/TinyLlama-1.1B-Chat-v1.0",
   "architectures": [
+    "LlamaForCausalLM"
   ],
   "attention_bias": false,
   "attention_dropout": 0.0,
+  "bos_token_id": 1,
+  "eos_token_id": 2,
+  "hidden_act": "silu",
   "hidden_size": 2048,
   "initializer_range": 0.02,
+  "intermediate_size": 5632,
+  "max_position_embeddings": 2048,
+  "model_type": "llama",
+  "num_attention_heads": 32,
+  "num_hidden_layers": 38,
+  "num_key_value_heads": 4,
+  "pretraining_tp": 1,
+  "rms_norm_eps": 1e-05,
   "rope_scaling": null,
   "rope_theta": 10000.0,
+  "tie_word_embeddings": false,
   "torch_dtype": "bfloat16",
   "transformers_version": "4.38.2",
   "use_cache": true,
+  "vocab_size": 32000
 }

mergekit_config.yml CHANGED Viewed

@@ -17,7 +17,7 @@ slices:
       layer_range: [0, 16]
   - sources:
     - model: TinyLlama/TinyLlama-1.1B-Chat-v1.0
-      layer_range: [6, 22]
 merge_method: passthrough
 dtype: bfloat16
 # models:

       layer_range: [0, 16]
   - sources:
     - model: TinyLlama/TinyLlama-1.1B-Chat-v1.0
+      layer_range: [0, 22]
 merge_method: passthrough
 dtype: bfloat16
 # models:

model-00001-of-00003.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:67d09e774e277a84210be1f5636712a0e729e961034a225886e0784394795d26
-size 1993541152

 version https://git-lfs.github.com/spec/v1
+oid sha256:b18a3ebdf3646de3a62303e61cb0227de96b47bf3b4090e7417c52795e5a1dc7
+size 1980958200

model-00002-of-00003.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:87520a9287547ad16392c5fa9c71aab20cb45f0ac9e5609856bd60ab584476c5
-size 1177652152

 version https://git-lfs.github.com/spec/v1
+oid sha256:56c3bbf7b6d6e9d2bc375afb91361bbfea500df4bdd7f60598fd530ecd2b5ddf
+size 1849844928

model.safetensors.index.json CHANGED Viewed

@@ -1 +1 @@

- {"metadata": {"mergekit_version": "0.0.4.2", "total_size": 4219736064}, "weight_map": {"model.norm.weight": "model-00001-of-00003.safetensors", "model.layers.31.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.31.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.31.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.31.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.31.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.31.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.31.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.31.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.31.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.30.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.30.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.30.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.30.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.30.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.30.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.30.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.30.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.30.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.29.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.29.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.29.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.29.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.29.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.29.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.29.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.29.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.29.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.28.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.28.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.28.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.28.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.28.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.28.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.28.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.28.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.28.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.27.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.27.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.27.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.27.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.27.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.27.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.27.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.27.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.27.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.26.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.26.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.26.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.26.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.26.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.26.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.26.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.26.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.26.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.25.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.25.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.25.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.25.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.25.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.25.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.25.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.25.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.25.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.24.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.24.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.24.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.24.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.24.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.24.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.24.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.24.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.24.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.23.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.23.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.23.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.23.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.23.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.23.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.23.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.23.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.23.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.22.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.22.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.22.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.22.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.22.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.22.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.22.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.22.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.22.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.21.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.21.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.21.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.21.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.21.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.21.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.21.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.21.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.21.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.20.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.20.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.20.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.20.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.20.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.20.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.20.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.20.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.20.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.19.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.19.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.19.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.19.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.19.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.19.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.19.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.19.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.19.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.18.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.18.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.18.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.18.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.18.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.18.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.18.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.18.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.18.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.17.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.17.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.17.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.17.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.17.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.17.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.17.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.17.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.17.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.16.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.16.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.16.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.16.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.16.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.16.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.16.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.16.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.16.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.15.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.15.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.15.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.15.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.15.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.15.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.15.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.15.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.15.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.14.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.14.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.14.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.14.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.14.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.14.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.14.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.14.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.14.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.13.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.13.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.13.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.13.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.13.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.13.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.13.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.13.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.13.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.12.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.12.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.12.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.12.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.12.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.12.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.12.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.12.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.12.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.11.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.11.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.11.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.11.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.11.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.11.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.11.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.11.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.11.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.10.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.10.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.10.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.10.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.10.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.10.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.10.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.9.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.9.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.9.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.9.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.9.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.9.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.9.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.8.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.8.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.8.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.8.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.8.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.8.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.8.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.8.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.8.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.7.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.7.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.7.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.7.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.7.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.7.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.7.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.7.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.7.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.6.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.6.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.6.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.6.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.6.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.6.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.6.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.6.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.6.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.5.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.5.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.5.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.5.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.5.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.5.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.5.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.5.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.5.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.4.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.4.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.4.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.4.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.4.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.4.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.4.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.4.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.4.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.3.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.3.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.3.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.3.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.3.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.3.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.3.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.3.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.3.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.2.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.2.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.2.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.2.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.2.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.2.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.2.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.2.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.2.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.1.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.1.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.1.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.1.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.1.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.1.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.1.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.1.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.1.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.0.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.0.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.0.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.0.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.0.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.0.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.0.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.0.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.0.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.embed_tokens.weight": "model-00003-of-00003.safetensors"}}

+ {"metadata": {"mergekit_version": "0.0.4.2", "total_size": 4879339520}, "weight_map": {"lm_head.weight": "model-00001-of-00003.safetensors", "model.norm.weight": "model-00001-of-00003.safetensors", "model.layers.37.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.37.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.37.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.37.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.37.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.37.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.37.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.37.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.37.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.36.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.36.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.36.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.36.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.36.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.36.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.36.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.36.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.36.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.35.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.35.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.35.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.35.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.35.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.35.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.35.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.35.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.35.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.34.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.34.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.34.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.34.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.34.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.34.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.34.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.34.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.34.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.33.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.33.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.33.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.33.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.33.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.33.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.33.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.33.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.33.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.32.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.32.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.32.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.32.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.32.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.32.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.32.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.32.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.32.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.31.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.31.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.31.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.31.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.31.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.31.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.31.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.31.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.31.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.30.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.30.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.30.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.30.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.30.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.30.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.30.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.30.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.30.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.29.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.29.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.29.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.29.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.29.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.29.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.29.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.29.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.29.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.28.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.28.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.28.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.28.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.28.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.28.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.28.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.28.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.28.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.27.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.27.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.27.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.27.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.27.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.27.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.27.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.27.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.27.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.26.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.26.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.26.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.26.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.26.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.26.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.26.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.26.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.26.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.25.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.25.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.25.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.25.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.25.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.25.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.25.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.25.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.25.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.24.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.24.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.24.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.24.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.24.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.24.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.24.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.24.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.24.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.23.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.23.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.23.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.23.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.23.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.23.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.23.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.23.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.23.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.22.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.22.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.22.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.22.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.22.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.22.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.22.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.22.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.22.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.21.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.21.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.21.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.21.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.21.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.21.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.21.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.21.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.21.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.20.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.20.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.20.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.20.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.20.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.20.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.20.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.20.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.20.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.19.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.19.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.19.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.19.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.19.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.19.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.19.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.19.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.19.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.18.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.18.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.18.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.18.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.18.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.18.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.18.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.18.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.18.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.17.mlp.down_proj.weight": "model-00001-of-00003.safetensors", "model.layers.17.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", "model.layers.17.mlp.up_proj.weight": "model-00001-of-00003.safetensors", "model.layers.17.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.17.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", "model.layers.17.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", "model.layers.17.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", "model.layers.17.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", "model.layers.17.input_layernorm.weight": "model-00001-of-00003.safetensors", "model.layers.16.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.16.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.16.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.16.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.16.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.16.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.16.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.15.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.15.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.15.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.15.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.15.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.15.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.15.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.15.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.14.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.14.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.14.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.14.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.14.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.14.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.14.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.13.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.13.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.13.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.13.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.13.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.13.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.13.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.12.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.12.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.12.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.12.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.12.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.12.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.11.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.11.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.11.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.11.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.11.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.10.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.10.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.10.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.10.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.10.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.10.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.10.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.9.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.9.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.9.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.9.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.9.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.9.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.9.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.8.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.8.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.8.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.8.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.8.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.8.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.8.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.8.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.8.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.7.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.7.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.7.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.7.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.7.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.7.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.7.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.7.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.7.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.6.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.6.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.6.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.6.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.6.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.6.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.6.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.6.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.6.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.5.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.5.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.5.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.5.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.5.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.5.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.5.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.5.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.5.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.4.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.4.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.4.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.4.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.4.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.4.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.4.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.4.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.4.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.3.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.3.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.3.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.3.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.3.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.3.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.3.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.3.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.3.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.2.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.2.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.2.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.2.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.2.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.2.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.2.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.2.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.2.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.1.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.1.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.1.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.1.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.1.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.1.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.1.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.1.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.1.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.0.mlp.down_proj.weight": "model-00002-of-00003.safetensors", "model.layers.0.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", "model.layers.0.mlp.up_proj.weight": "model-00002-of-00003.safetensors", "model.layers.0.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", "model.layers.0.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", "model.layers.0.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", "model.layers.0.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", "model.layers.0.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", "model.layers.0.input_layernorm.weight": "model-00002-of-00003.safetensors", "model.embed_tokens.weight": "model-00003-of-00003.safetensors"}}

special_tokens_map.json CHANGED Viewed

@@ -1,24 +1,20 @@
 {
-  "additional_special_tokens": [
-    "<start_of_turn>",
-    "<end_of_turn>"
-  ],
   "bos_token": {
-    "content": "<bos>",
     "lstrip": false,
     "normalized": false,
     "rstrip": false,
     "single_word": false
   },
   "eos_token": {
-    "content": "<eos>",
     "lstrip": false,
     "normalized": false,
     "rstrip": false,
     "single_word": false
   },
   "pad_token": {
-    "content": "<pad>",
     "lstrip": false,
     "normalized": false,
     "rstrip": false,

 {
   "bos_token": {
+    "content": "<s>",
     "lstrip": false,
     "normalized": false,
     "rstrip": false,
     "single_word": false
   },
   "eos_token": {
+    "content": "</s>",
     "lstrip": false,
     "normalized": false,
     "rstrip": false,
     "single_word": false
   },
   "pad_token": {
+    "content": "</s>",
     "lstrip": false,
     "normalized": false,
     "rstrip": false,

tokenizer.json CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:05e97791a5e007260de1db7e1692e53150e08cea481e2bf25435553380c147ee
-size 17477929

 version https://git-lfs.github.com/spec/v1
+oid sha256:bcd04f0eadf90287bd26e1a183ac487d8a141b09b06aecb7725bbdd343640f2e
+size 1842767

tokenizer.model CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:61a7b147390c64585d6c3543dd6fc636906c9af3865a5548f27f31aee1d4c8e2
-size 4241003

 version https://git-lfs.github.com/spec/v1
+oid sha256:9e556afd44213b6bd1be2b850ebbbd98f5481437a8021afaf58ee7fb1818d347
+size 499723

tokenizer_config.json CHANGED Viewed

@@ -3,7 +3,7 @@
   "add_eos_token": false,
   "added_tokens_decoder": {
     "0": {
-      "content": "<pad>",
       "lstrip": false,
       "normalized": false,
       "rstrip": false,
@@ -11,7 +11,7 @@
       "special": true
     },
     "1": {
-      "content": "<eos>",
       "lstrip": false,
       "normalized": false,
       "rstrip": false,
@@ -19,31 +19,7 @@
       "special": true
     },
     "2": {
-      "content": "<bos>",
-      "lstrip": false,
-      "normalized": false,
-      "rstrip": false,
-      "single_word": false,
-      "special": true
-    },
-    "3": {
-      "content": "<unk>",
-      "lstrip": false,
-      "normalized": false,
-      "rstrip": false,
-      "single_word": false,
-      "special": true
-    },
-    "106": {
-      "content": "<start_of_turn>",
-      "lstrip": false,
-      "normalized": false,
-      "rstrip": false,
-      "single_word": false,
-      "special": true
-    },
-    "107": {
-      "content": "<end_of_turn>",
       "lstrip": false,
       "normalized": false,
       "rstrip": false,
@@ -51,20 +27,16 @@
       "special": true
     }
   },
-  "additional_special_tokens": [
-    "<start_of_turn>",
-    "<end_of_turn>"
-  ],
-  "bos_token": "<bos>",
-  "chat_template": "{{ bos_token }}{% if messages[0]['role'] == 'system' %}{{ raise_exception('System role not supported') }}{% endif %}{% for message in messages %}{% if (message['role'] == 'user') != (loop.index0 % 2 == 0) %}{{ raise_exception('Conversation roles must alternate user/assistant/user/assistant/...') }}{% endif %}{% if (message['role'] == 'assistant') %}{% set role = 'model' %}{% else %}{% set role = message['role'] %}{% endif %}{{ '<start_of_turn>' + role + '\n' + message['content'] | trim + '<end_of_turn>\n' }}{% endfor %}{% if add_generation_prompt %}{{'<start_of_turn>model\n'}}{% endif %}",
   "clean_up_tokenization_spaces": false,
-  "eos_token": "<eos>",
-  "legacy": null,
-  "model_max_length": 1000000000000000019884624838656,
-  "pad_token": "<pad>",
   "sp_model_kwargs": {},
-  "spaces_between_special_tokens": false,
-  "tokenizer_class": "GemmaTokenizer",
   "unk_token": "<unk>",
   "use_default_system_prompt": false
 }

   "add_eos_token": false,
   "added_tokens_decoder": {
     "0": {
+      "content": "<unk>",
       "lstrip": false,
       "normalized": false,
       "rstrip": false,
       "special": true
     },
     "1": {
+      "content": "<s>",
       "lstrip": false,
       "normalized": false,
       "rstrip": false,
       "special": true
     },
     "2": {
+      "content": "</s>",
       "lstrip": false,
       "normalized": false,
       "rstrip": false,
       "special": true
     }
   },
+  "bos_token": "<s>",
+  "chat_template": "{% for message in messages %}\n{% if message['role'] == 'user' %}\n{{ '<|user|>\n' + message['content'] + eos_token }}\n{% elif message['role'] == 'system' %}\n{{ '<|system|>\n' + message['content'] + eos_token }}\n{% elif message['role'] == 'assistant' %}\n{{ '<|assistant|>\n'  + message['content'] + eos_token }}\n{% endif %}\n{% if loop.last and add_generation_prompt %}\n{{ '<|assistant|>' }}\n{% endif %}\n{% endfor %}",
   "clean_up_tokenization_spaces": false,
+  "eos_token": "</s>",
+  "legacy": false,
+  "model_max_length": 2048,
+  "pad_token": "</s>",
+  "padding_side": "right",
   "sp_model_kwargs": {},
+  "tokenizer_class": "LlamaTokenizer",
   "unk_token": "<unk>",
   "use_default_system_prompt": false
 }