Upload folder using huggingface_hub

Browse files

Files changed (13) hide show

README.md +43 -0
config.json +193 -0
generation_config.json +12 -0
merges.txt +0 -0
model.safetensors +3 -0
model.safetensors.index.json +946 -0
preprocessor_config.json +6 -0
speech_tokenizer/config.json +94 -0
speech_tokenizer/configuration.json +1 -0
speech_tokenizer/model.safetensors +3 -0
speech_tokenizer/preprocessor_config.json +10 -0
tokenizer_config.json +316 -0
vocab.json +0 -0

README.md ADDED Viewed

	@@ -0,0 +1,43 @@

+---
+license: apache-2.0
+library_name: mlx-audio
+tags:
+- mlx
+- text-to-speech
+- speech
+- speech generation
+- voice cloning
+- tts
+- mlx-audio
+---
+# mlx-community/Qwen3-TTS-12Hz-1.7B-CustomVoice-8bit
+This model was converted to MLX format from [`Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice`](https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice) using mlx-audio version **0.3.0rc1**.
+Refer to the [original model card](https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice) for more details on the model.
+## Use with mlx-audio
+```bash
+pip install -U mlx-audio
+```
+### CLI Example:
+```bash
+python -m mlx_audio.tts.generate --model mlx-community/Qwen3-TTS-12Hz-1.7B-CustomVoice-8bit --text "Hello, this is a test."
+```
+### Python Example:
+```python
+from mlx_audio.tts.utils import load_model
+from mlx_audio.tts.generate import generate_audio
+model = load_model("mlx-community/Qwen3-TTS-12Hz-1.7B-CustomVoice-8bit")
+generate_audio(
+    model=model,
+    text="Hello, this is a test.",
+    ref_audio="path_to_audio.wav",
+    file_prefix="test_audio",
+)
+```

config.json ADDED Viewed

	@@ -0,0 +1,193 @@

+{
+    "architectures": [
+        "Qwen3TTSForConditionalGeneration"
+    ],
+    "assistant_token_id": 77091,
+    "im_end_token_id": 151645,
+    "im_start_token_id": 151644,
+    "model_type": "qwen3_tts",
+    "quantization": {
+        "group_size": 64,
+        "bits": 8,
+        "mode": "affine"
+    },
+    "quantization_config": {
+        "group_size": 64,
+        "bits": 8,
+        "mode": "affine"
+    },
+    "talker_config": {
+        "attention_bias": false,
+        "attention_dropout": 0,
+        "code_predictor_config": {
+            "_name_or_path": "",
+            "add_cross_attention": false,
+            "architectures": null,
+            "attention_bias": false,
+            "attention_dropout": 0,
+            "bad_words_ids": null,
+            "begin_suppress_tokens": null,
+            "bos_token_id": null,
+            "chunk_size_feed_forward": 0,
+            "cross_attention_hidden_size": null,
+            "decoder_start_token_id": null,
+            "diversity_penalty": 0.0,
+            "do_sample": false,
+            "early_stopping": false,
+            "encoder_no_repeat_ngram_size": 0,
+            "eos_token_id": null,
+            "exponential_decay_length_penalty": null,
+            "finetuning_task": null,
+            "forced_bos_token_id": null,
+            "forced_eos_token_id": null,
+            "head_dim": 128,
+            "hidden_act": "silu",
+            "hidden_size": 1024,
+            "id2label": {
+                "0": "LABEL_0",
+                "1": "LABEL_1"
+            },
+            "initializer_range": 0.02,
+            "intermediate_size": 3072,
+            "is_decoder": false,
+            "is_encoder_decoder": false,
+            "label2id": {
+                "LABEL_0": 0,
+                "LABEL_1": 1
+            },
+            "layer_types": [
+                "full_attention",
+                "full_attention",
+                "full_attention",
+                "full_attention",
+                "full_attention"
+            ],
+            "length_penalty": 1.0,
+            "max_length": 20,
+            "max_position_embeddings": 65536,
+            "max_window_layers": 28,
+            "min_length": 0,
+            "model_type": "qwen3_tts_talker_code_predictor",
+            "no_repeat_ngram_size": 0,
+            "num_attention_heads": 16,
+            "num_beam_groups": 1,
+            "num_beams": 1,
+            "num_code_groups": 16,
+            "num_hidden_layers": 5,
+            "num_key_value_heads": 8,
+            "num_return_sequences": 1,
+            "output_attentions": false,
+            "output_hidden_states": false,
+            "output_scores": false,
+            "pad_token_id": null,
+            "prefix": null,
+            "problem_type": null,
+            "pruned_heads": {},
+            "remove_invalid_values": false,
+            "repetition_penalty": 1.0,
+            "return_dict": true,
+            "return_dict_in_generate": false,
+            "rms_norm_eps": 1e-06,
+            "rope_scaling": null,
+            "rope_theta": 1000000,
+            "sep_token_id": null,
+            "sliding_window": null,
+            "suppress_tokens": null,
+            "task_specific_params": null,
+            "temperature": 1.0,
+            "tf_legacy_loss": false,
+            "tie_encoder_decoder": false,
+            "tie_word_embeddings": false,
+            "tokenizer_class": null,
+            "top_k": 50,
+            "top_p": 1.0,
+            "dtype": null,
+            "torchscript": false,
+            "typical_p": 1.0,
+            "use_bfloat16": false,
+            "use_cache": true,
+            "use_sliding_window": false,
+            "vocab_size": 2048
+        },
+        "codec_bos_id": 2149,
+        "codec_eos_token_id": 2150,
+        "codec_think_id": 2154,
+        "codec_language_id": {
+            "chinese": 2055,
+            "english": 2050,
+            "german": 2053,
+            "italian": 2070,
+            "portuguese": 2071,
+            "spanish": 2054,
+            "japanese": 2058,
+            "korean": 2064,
+            "french": 2061,
+            "russian": 2069,
+            "beijing_dialect": 2074,
+            "sichuan_dialect": 2062
+        },
+        "codec_nothink_id": 2155,
+        "codec_pad_id": 2148,
+        "codec_think_bos_id": 2156,
+        "codec_think_eos_id": 2157,
+        "spk_id": {
+            "serena": 3066,
+            "vivian": 3065,
+            "uncle_fu": 3010,
+            "ryan": 3061,
+            "aiden": 2861,
+            "ono_anna": 2873,
+            "sohee": 2864,
+            "eric": 2875,
+            "dylan": 2878
+        },
+        "spk_is_dialect": {
+            "serena": false,
+            "vivian": false,
+            "uncle_fu": false,
+            "ryan": false,
+            "aiden": false,
+            "ono_anna": false,
+            "sohee": false,
+            "eric": "sichuan_dialect",
+            "dylan": "beijing_dialect"
+        },
+        "head_dim": 128,
+        "hidden_act": "silu",
+        "hidden_size": 2048,
+        "initializer_range": 0.02,
+        "intermediate_size": 6144,
+        "max_position_embeddings": 32768,
+        "model_type": "qwen3_tts_talker",
+        "num_attention_heads": 16,
+        "num_code_groups": 16,
+        "num_hidden_layers": 28,
+        "num_key_value_heads": 8,
+        "position_id_per_seconds": 13,
+        "rms_norm_eps": 1e-06,
+        "rope_scaling": {
+            "interleaved": true,
+            "mrope_section": [
+                24,
+                20,
+                20
+            ],
+            "rope_type": "default",
+            "type": "default"
+        },
+        "rope_theta": 1000000,
+        "sliding_window": null,
+        "text_hidden_size": 2048,
+        "text_vocab_size": 151936,
+        "use_cache": true,
+        "use_sliding_window": false,
+        "vocab_size": 3072
+    },
+    "tokenizer_type": "qwen3_tts_tokenizer_12hz",
+    "transformers_version": "4.57.3",
+    "tts_bos_token_id": 151672,
+    "tts_eos_token_id": 151673,
+    "tts_model_size": "1b7",
+    "tts_model_type": "custom_voice",
+    "tts_pad_token_id": 151671
+}

generation_config.json ADDED Viewed

	@@ -0,0 +1,12 @@

+{
+  "do_sample": true,
+  "repetition_penalty": 1.05,
+  "temperature": 0.9,
+  "top_p": 1.0,
+  "top_k": 50,
+  "subtalker_dosample": true,
+  "subtalker_temperature": 0.9,
+  "subtalker_top_p": 1.0,
+  "subtalker_top_k": 50,
+  "max_new_tokens": 8192
+}

merges.txt ADDED Viewed

The diff for this file is too large to render. See raw diff

model.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:33518008c2920b3f4dcc829900cf3a3f670ba9da693c28b24371114e9f58cee0
+size 2036715355

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,946 @@

+{
+    "metadata": {
+        "total_size": 2036601344,
+        "total_parameters": 1916676352
+    },
+    "weight_map": {
+        "talker.code_predictor.lm_head.0.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.0.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.0.weight": "model.safetensors",
+        "talker.code_predictor.lm_head.1.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.1.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.1.weight": "model.safetensors",
+        "talker.code_predictor.lm_head.10.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.10.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.10.weight": "model.safetensors",
+        "talker.code_predictor.lm_head.11.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.11.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.11.weight": "model.safetensors",
+        "talker.code_predictor.lm_head.12.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.12.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.12.weight": "model.safetensors",
+        "talker.code_predictor.lm_head.13.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.13.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.13.weight": "model.safetensors",
+        "talker.code_predictor.lm_head.14.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.14.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.14.weight": "model.safetensors",
+        "talker.code_predictor.lm_head.2.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.2.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.2.weight": "model.safetensors",
+        "talker.code_predictor.lm_head.3.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.3.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.3.weight": "model.safetensors",
+        "talker.code_predictor.lm_head.4.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.4.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.4.weight": "model.safetensors",
+        "talker.code_predictor.lm_head.5.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.5.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.5.weight": "model.safetensors",
+        "talker.code_predictor.lm_head.6.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.6.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.6.weight": "model.safetensors",
+        "talker.code_predictor.lm_head.7.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.7.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.7.weight": "model.safetensors",
+        "talker.code_predictor.lm_head.8.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.8.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.8.weight": "model.safetensors",
+        "talker.code_predictor.lm_head.9.biases": "model.safetensors",
+        "talker.code_predictor.lm_head.9.scales": "model.safetensors",
+        "talker.code_predictor.lm_head.9.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.0.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.0.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.0.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.1.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.1.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.1.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.10.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.10.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.10.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.11.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.11.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.11.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.12.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.12.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.12.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.13.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.13.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.13.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.14.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.14.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.14.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.2.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.2.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.2.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.3.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.3.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.3.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.4.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.4.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.4.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.5.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.5.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.5.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.6.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.6.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.6.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.7.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.7.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.7.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.8.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.8.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.8.weight": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.9.biases": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.9.scales": "model.safetensors",
+        "talker.code_predictor.model.codec_embedding.9.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.0.input_layernorm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.0.mlp.down_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.0.mlp.down_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.0.mlp.down_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.0.mlp.gate_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.0.mlp.gate_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.0.mlp.gate_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.0.mlp.up_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.0.mlp.up_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.0.mlp.up_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.0.post_attention_layernorm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.0.self_attn.k_norm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.0.self_attn.k_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.0.self_attn.k_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.0.self_attn.k_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.0.self_attn.o_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.0.self_attn.o_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.0.self_attn.o_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.0.self_attn.q_norm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.0.self_attn.q_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.0.self_attn.q_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.0.self_attn.q_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.0.self_attn.v_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.0.self_attn.v_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.0.self_attn.v_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.1.input_layernorm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.1.mlp.down_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.1.mlp.down_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.1.mlp.down_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.1.mlp.gate_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.1.mlp.gate_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.1.mlp.gate_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.1.mlp.up_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.1.mlp.up_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.1.mlp.up_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.1.post_attention_layernorm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.1.self_attn.k_norm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.1.self_attn.k_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.1.self_attn.k_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.1.self_attn.k_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.1.self_attn.o_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.1.self_attn.o_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.1.self_attn.o_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.1.self_attn.q_norm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.1.self_attn.q_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.1.self_attn.q_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.1.self_attn.q_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.1.self_attn.v_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.1.self_attn.v_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.1.self_attn.v_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.2.input_layernorm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.2.mlp.down_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.2.mlp.down_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.2.mlp.down_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.2.mlp.gate_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.2.mlp.gate_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.2.mlp.gate_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.2.mlp.up_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.2.mlp.up_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.2.mlp.up_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.2.post_attention_layernorm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.2.self_attn.k_norm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.2.self_attn.k_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.2.self_attn.k_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.2.self_attn.k_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.2.self_attn.o_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.2.self_attn.o_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.2.self_attn.o_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.2.self_attn.q_norm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.2.self_attn.q_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.2.self_attn.q_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.2.self_attn.q_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.2.self_attn.v_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.2.self_attn.v_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.2.self_attn.v_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.3.input_layernorm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.3.mlp.down_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.3.mlp.down_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.3.mlp.down_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.3.mlp.gate_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.3.mlp.gate_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.3.mlp.gate_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.3.mlp.up_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.3.mlp.up_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.3.mlp.up_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.3.post_attention_layernorm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.3.self_attn.k_norm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.3.self_attn.k_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.3.self_attn.k_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.3.self_attn.k_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.3.self_attn.o_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.3.self_attn.o_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.3.self_attn.o_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.3.self_attn.q_norm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.3.self_attn.q_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.3.self_attn.q_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.3.self_attn.q_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.3.self_attn.v_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.3.self_attn.v_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.3.self_attn.v_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.4.input_layernorm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.4.mlp.down_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.4.mlp.down_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.4.mlp.down_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.4.mlp.gate_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.4.mlp.gate_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.4.mlp.gate_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.4.mlp.up_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.4.mlp.up_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.4.mlp.up_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.4.post_attention_layernorm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.4.self_attn.k_norm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.4.self_attn.k_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.4.self_attn.k_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.4.self_attn.k_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.4.self_attn.o_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.4.self_attn.o_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.4.self_attn.o_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.4.self_attn.q_norm.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.4.self_attn.q_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.4.self_attn.q_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.4.self_attn.q_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.layers.4.self_attn.v_proj.biases": "model.safetensors",
+        "talker.code_predictor.model.layers.4.self_attn.v_proj.scales": "model.safetensors",
+        "talker.code_predictor.model.layers.4.self_attn.v_proj.weight": "model.safetensors",
+        "talker.code_predictor.model.norm.weight": "model.safetensors",
+        "talker.code_predictor.small_to_mtp_projection.bias": "model.safetensors",
+        "talker.code_predictor.small_to_mtp_projection.biases": "model.safetensors",
+        "talker.code_predictor.small_to_mtp_projection.scales": "model.safetensors",
+        "talker.code_predictor.small_to_mtp_projection.weight": "model.safetensors",
+        "talker.codec_head.biases": "model.safetensors",
+        "talker.codec_head.scales": "model.safetensors",
+        "talker.codec_head.weight": "model.safetensors",
+        "talker.model.codec_embedding.biases": "model.safetensors",
+        "talker.model.codec_embedding.scales": "model.safetensors",
+        "talker.model.codec_embedding.weight": "model.safetensors",
+        "talker.model.layers.0.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.0.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.0.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.0.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.0.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.0.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.0.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.0.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.0.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.0.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.0.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.0.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.0.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.0.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.0.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.0.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.0.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.0.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.0.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.0.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.0.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.0.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.0.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.0.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.0.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.1.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.1.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.1.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.1.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.1.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.1.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.1.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.1.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.1.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.1.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.1.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.1.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.1.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.1.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.1.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.1.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.1.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.1.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.1.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.1.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.1.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.1.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.1.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.1.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.1.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.10.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.10.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.10.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.10.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.10.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.10.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.10.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.10.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.10.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.10.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.10.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.10.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.10.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.10.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.10.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.10.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.10.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.10.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.10.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.10.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.10.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.10.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.10.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.10.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.10.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.11.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.11.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.11.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.11.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.11.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.11.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.11.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.11.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.11.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.11.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.11.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.11.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.11.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.11.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.11.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.11.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.11.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.11.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.11.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.11.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.11.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.11.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.11.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.11.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.11.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.12.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.12.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.12.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.12.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.12.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.12.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.12.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.12.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.12.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.12.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.12.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.12.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.12.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.12.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.12.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.12.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.12.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.12.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.12.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.12.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.12.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.12.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.12.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.12.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.12.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.13.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.13.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.13.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.13.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.13.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.13.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.13.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.13.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.13.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.13.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.13.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.13.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.13.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.13.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.13.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.13.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.13.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.13.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.13.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.13.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.13.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.13.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.13.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.13.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.13.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.14.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.14.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.14.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.14.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.14.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.14.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.14.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.14.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.14.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.14.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.14.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.14.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.14.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.14.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.14.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.14.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.14.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.14.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.14.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.14.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.14.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.14.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.14.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.14.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.14.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.15.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.15.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.15.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.15.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.15.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.15.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.15.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.15.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.15.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.15.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.15.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.15.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.15.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.15.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.15.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.15.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.15.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.15.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.15.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.15.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.15.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.15.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.15.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.15.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.15.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.16.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.16.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.16.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.16.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.16.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.16.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.16.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.16.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.16.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.16.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.16.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.16.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.16.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.16.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.16.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.16.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.16.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.16.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.16.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.16.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.16.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.16.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.16.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.16.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.16.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.17.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.17.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.17.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.17.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.17.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.17.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.17.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.17.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.17.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.17.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.17.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.17.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.17.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.17.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.17.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.17.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.17.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.17.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.17.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.17.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.17.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.17.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.17.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.17.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.17.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.18.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.18.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.18.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.18.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.18.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.18.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.18.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.18.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.18.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.18.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.18.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.18.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.18.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.18.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.18.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.18.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.18.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.18.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.18.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.18.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.18.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.18.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.18.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.18.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.18.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.19.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.19.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.19.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.19.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.19.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.19.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.19.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.19.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.19.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.19.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.19.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.19.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.19.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.19.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.19.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.19.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.19.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.19.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.19.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.19.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.19.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.19.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.19.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.19.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.19.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.2.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.2.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.2.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.2.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.2.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.2.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.2.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.2.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.2.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.2.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.2.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.2.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.2.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.2.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.2.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.2.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.2.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.2.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.2.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.2.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.2.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.2.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.2.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.2.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.2.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.20.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.20.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.20.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.20.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.20.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.20.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.20.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.20.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.20.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.20.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.20.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.20.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.20.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.20.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.20.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.20.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.20.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.20.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.20.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.20.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.20.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.20.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.20.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.20.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.20.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.21.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.21.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.21.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.21.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.21.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.21.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.21.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.21.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.21.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.21.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.21.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.21.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.21.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.21.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.21.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.21.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.21.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.21.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.21.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.21.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.21.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.21.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.21.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.21.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.21.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.22.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.22.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.22.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.22.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.22.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.22.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.22.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.22.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.22.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.22.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.22.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.22.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.22.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.22.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.22.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.22.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.22.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.22.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.22.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.22.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.22.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.22.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.22.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.22.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.22.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.23.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.23.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.23.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.23.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.23.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.23.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.23.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.23.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.23.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.23.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.23.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.23.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.23.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.23.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.23.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.23.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.23.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.23.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.23.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.23.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.23.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.23.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.23.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.23.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.23.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.24.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.24.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.24.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.24.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.24.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.24.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.24.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.24.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.24.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.24.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.24.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.24.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.24.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.24.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.24.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.24.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.24.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.24.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.24.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.24.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.24.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.24.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.24.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.24.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.24.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.25.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.25.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.25.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.25.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.25.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.25.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.25.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.25.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.25.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.25.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.25.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.25.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.25.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.25.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.25.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.25.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.25.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.25.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.25.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.25.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.25.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.25.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.25.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.25.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.25.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.26.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.26.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.26.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.26.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.26.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.26.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.26.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.26.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.26.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.26.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.26.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.26.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.26.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.26.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.26.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.26.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.26.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.26.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.26.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.26.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.26.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.26.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.26.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.26.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.26.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.27.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.27.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.27.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.27.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.27.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.27.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.27.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.27.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.27.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.27.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.27.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.27.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.27.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.27.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.27.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.27.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.27.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.27.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.27.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.27.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.27.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.27.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.27.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.27.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.27.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.3.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.3.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.3.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.3.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.3.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.3.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.3.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.3.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.3.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.3.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.3.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.3.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.3.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.3.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.3.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.3.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.3.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.3.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.3.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.3.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.3.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.3.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.3.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.3.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.3.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.4.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.4.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.4.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.4.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.4.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.4.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.4.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.4.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.4.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.4.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.4.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.4.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.4.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.4.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.4.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.4.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.4.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.4.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.4.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.4.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.4.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.4.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.4.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.4.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.4.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.5.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.5.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.5.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.5.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.5.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.5.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.5.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.5.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.5.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.5.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.5.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.5.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.5.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.5.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.5.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.5.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.5.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.5.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.5.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.5.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.5.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.5.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.5.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.5.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.5.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.6.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.6.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.6.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.6.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.6.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.6.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.6.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.6.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.6.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.6.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.6.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.6.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.6.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.6.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.6.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.6.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.6.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.6.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.6.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.6.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.6.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.6.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.6.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.6.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.6.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.7.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.7.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.7.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.7.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.7.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.7.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.7.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.7.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.7.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.7.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.7.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.7.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.7.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.7.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.7.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.7.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.7.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.7.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.7.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.7.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.7.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.7.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.7.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.7.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.7.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.8.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.8.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.8.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.8.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.8.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.8.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.8.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.8.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.8.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.8.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.8.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.8.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.8.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.8.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.8.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.8.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.8.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.8.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.8.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.8.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.8.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.8.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.8.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.8.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.8.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.layers.9.input_layernorm.weight": "model.safetensors",
+        "talker.model.layers.9.mlp.down_proj.biases": "model.safetensors",
+        "talker.model.layers.9.mlp.down_proj.scales": "model.safetensors",
+        "talker.model.layers.9.mlp.down_proj.weight": "model.safetensors",
+        "talker.model.layers.9.mlp.gate_proj.biases": "model.safetensors",
+        "talker.model.layers.9.mlp.gate_proj.scales": "model.safetensors",
+        "talker.model.layers.9.mlp.gate_proj.weight": "model.safetensors",
+        "talker.model.layers.9.mlp.up_proj.biases": "model.safetensors",
+        "talker.model.layers.9.mlp.up_proj.scales": "model.safetensors",
+        "talker.model.layers.9.mlp.up_proj.weight": "model.safetensors",
+        "talker.model.layers.9.post_attention_layernorm.weight": "model.safetensors",
+        "talker.model.layers.9.self_attn.k_norm.weight": "model.safetensors",
+        "talker.model.layers.9.self_attn.k_proj.biases": "model.safetensors",
+        "talker.model.layers.9.self_attn.k_proj.scales": "model.safetensors",
+        "talker.model.layers.9.self_attn.k_proj.weight": "model.safetensors",
+        "talker.model.layers.9.self_attn.o_proj.biases": "model.safetensors",
+        "talker.model.layers.9.self_attn.o_proj.scales": "model.safetensors",
+        "talker.model.layers.9.self_attn.o_proj.weight": "model.safetensors",
+        "talker.model.layers.9.self_attn.q_norm.weight": "model.safetensors",
+        "talker.model.layers.9.self_attn.q_proj.biases": "model.safetensors",
+        "talker.model.layers.9.self_attn.q_proj.scales": "model.safetensors",
+        "talker.model.layers.9.self_attn.q_proj.weight": "model.safetensors",
+        "talker.model.layers.9.self_attn.v_proj.biases": "model.safetensors",
+        "talker.model.layers.9.self_attn.v_proj.scales": "model.safetensors",
+        "talker.model.layers.9.self_attn.v_proj.weight": "model.safetensors",
+        "talker.model.norm.weight": "model.safetensors",
+        "talker.model.text_embedding.biases": "model.safetensors",
+        "talker.model.text_embedding.scales": "model.safetensors",
+        "talker.model.text_embedding.weight": "model.safetensors",
+        "talker.text_projection.linear_fc1.bias": "model.safetensors",
+        "talker.text_projection.linear_fc1.biases": "model.safetensors",
+        "talker.text_projection.linear_fc1.scales": "model.safetensors",
+        "talker.text_projection.linear_fc1.weight": "model.safetensors",
+        "talker.text_projection.linear_fc2.bias": "model.safetensors",
+        "talker.text_projection.linear_fc2.biases": "model.safetensors",
+        "talker.text_projection.linear_fc2.scales": "model.safetensors",
+        "talker.text_projection.linear_fc2.weight": "model.safetensors"
+    }
+}

preprocessor_config.json ADDED Viewed

	@@ -0,0 +1,6 @@

+{
+  "padding_side": "left",
+  "padding_value": 0.0,
+  "processor_class": "Qwen3TTSProcessor",
+  "return_attention_mask": true
+}

speech_tokenizer/config.json ADDED Viewed

	@@ -0,0 +1,94 @@

+{
+  "architectures": [
+    "Qwen3TTSTokenizerV2Model"
+  ],
+  "model_type": "qwen3_tts_tokenizer_12hz",
+  "encoder_valid_num_quantizers": 16,
+  "input_sample_rate": 24000,
+  "output_sample_rate": 24000,
+  "decode_upsample_rate": 1920,
+  "encode_downsample_rate": 1920,
+  "decoder_config": {
+    "attention_bias": false,
+    "attention_dropout": 0.0,
+    "latent_dim": 1024,
+    "codebook_dim": 512,
+    "codebook_size": 2048,
+    "decoder_dim": 1536,
+    "hidden_act": "silu",
+    "hidden_size": 512,
+    "intermediate_size": 1024,
+    "layer_scale_initial_scale": 0.01,
+    "max_position_embeddings": 8000,
+    "head_dim": 64,
+    "num_attention_heads": 16,
+    "num_hidden_layers": 8,
+    "num_key_value_heads": 16,
+    "num_quantizers": 16,
+    "num_semantic_quantizers": 1,
+    "rms_norm_eps": 1e-05,
+    "rope_theta": 10000,
+    "semantic_codebook_size": 4096,
+    "sliding_window": 72,
+    "upsample_rates": [
+      8,
+      5,
+      4,
+      3
+    ],
+    "upsampling_ratios": [
+      2,
+      2
+    ],
+    "vector_quantization_hidden_dimension": 512
+  },
+  "encoder_config": {
+    "_frame_rate": 12.5,
+    "attention_bias": false,
+    "attention_dropout": 0.0,
+    "audio_channels": 1,
+    "codebook_dim": 256,
+    "codebook_size": 2048,
+    "compress": 2,
+    "dilation_growth_rate": 2,
+    "dtype": "float32",
+    "head_dim": 64,
+    "hidden_act": "gelu",
+    "hidden_size": 512,
+    "initializer_range": 0.02,
+    "intermediate_size": 2048,
+    "kernel_size": 7,
+    "last_kernel_size": 3,
+    "layer_scale_initial_scale": 0.01,
+    "max_position_embeddings": 8000,
+    "norm_eps": 1e-05,
+    "normalize": false,
+    "num_attention_heads": 8,
+    "num_filters": 64,
+    "num_hidden_layers": 8,
+    "num_key_value_heads": 8,
+    "num_quantizers": 32,
+    "num_residual_layers": 1,
+    "num_semantic_quantizers": 1,
+    "pad_mode": "constant",
+    "residual_kernel_size": 3,
+    "rope_theta": 10000.0,
+    "sampling_rate": 24000,
+    "sliding_window": 250,
+    "transformers_version": "4.57.0.dev0",
+    "trim_right_ratio": 1.0,
+    "upsample_groups": 512,
+    "upsampling_ratios": [
+      8,
+      6,
+      5,
+      4
+    ],
+    "use_cache": false,
+    "use_causal_conv": true,
+    "use_conv_shortcut": false,
+    "use_streaming": false,
+    "vector_quantization_hidden_dimension": 256
+  },
+  "transformers_version": "4.57.3"
+}

speech_tokenizer/configuration.json ADDED Viewed

	@@ -0,0 +1 @@


1	+ {"framework": "pytorch", "task": "feature-extraction", "allow_remote": true}

speech_tokenizer/model.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:836b7b357f5ea43e889936a3709af68dfe3751881acefe4ecf0dbd30ba571258
+size 682293092

speech_tokenizer/preprocessor_config.json ADDED Viewed

	@@ -0,0 +1,10 @@

+{
+  "chunk_length_s": null,
+  "feature_extractor_type": "EncodecFeatureExtractor",
+  "feature_size": 1,
+  "overlap": null,
+  "padding_side": "right",
+  "padding_value": 0.0,
+  "return_attention_mask": true,
+  "sampling_rate": 24000
+}

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,316 @@

+{
+  "add_bos_token": false,
+  "add_prefix_space": false,
+  "added_tokens_decoder": {
+    "151643": {
+      "content": "<|endoftext|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151644": {
+      "content": "<|im_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151645": {
+      "content": "<|im_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151646": {
+      "content": "<|object_ref_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151647": {
+      "content": "<|object_ref_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151648": {
+      "content": "<|box_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151649": {
+      "content": "<|box_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151650": {
+      "content": "<|quad_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151651": {
+      "content": "<|quad_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151652": {
+      "content": "<|vision_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151653": {
+      "content": "<|vision_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151654": {
+      "content": "<|vision_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151655": {
+      "content": "<|image_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151656": {
+      "content": "<|video_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151657": {
+      "content": "<tool_call>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151658": {
+      "content": "</tool_call>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151659": {
+      "content": "<|fim_prefix|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151660": {
+      "content": "<|fim_middle|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151661": {
+      "content": "<|fim_suffix|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151662": {
+      "content": "<|fim_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151663": {
+      "content": "<|repo_name|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151664": {
+      "content": "<|file_sep|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151665": {
+      "content": "<tool_response>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151666": {
+      "content": "</tool_response>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151667": {
+      "content": "<think>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151668": {
+      "content": "</think>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151669": {
+      "content": "<|audio_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151670": {
+      "content": "<|audio_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151671": {
+      "content": "<tts_pad>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151672": {
+      "content": "<tts_text_bos>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151673": {
+      "content": "<tts_text_eod>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151674": {
+      "content": "<tts_text_bos_single>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151675": {
+      "content": "<|audio_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "additional_special_tokens": [
+    "<|im_start|>",
+    "<|im_end|>",
+    "<|object_ref_start|>",
+    "<|object_ref_end|>",
+    "<|box_start|>",
+    "<|box_end|>",
+    "<|quad_start|>",
+    "<|quad_end|>",
+    "<|vision_start|>",
+    "<|vision_end|>",
+    "<|vision_pad|>",
+    "<|image_pad|>",
+    "<|video_pad|>",
+    "<|audio_start|>",
+    "<|audio_end|>",
+    "<tts_pad>",
+    "<tts_text_bos>",
+    "<tts_text_bos_single>",
+    "<|audio_pad|>"
+  ],
+  "extra_special_tokens": {
+    "image_token": "<|image_pad|>",
+    "audio_token": "<|audio_pad|>",
+    "video_token": "<|video_pad|>",
+    "vision_bos_token": "<|vision_start|>",
+    "vision_eos_token": "<|vision_end|>",
+    "audio_bos_token": "<|audio_start|>",
+    "audio_eos_token": "<|audio_end|>"
+  },
+  "bos_token": null,
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "<|im_end|>",
+  "errors": "replace",
+  "model_max_length": 131072,
+  "pad_token": "<|endoftext|>",
+  "split_special_tokens": false,
+  "tokenizer_class": "Qwen2Tokenizer",
+  "unk_token": null,
+  "image_token": "<|image_pad|>",
+  "audio_token": "<|audio_pad|>",
+  "video_token": "<|video_pad|>",
+  "vision_bos_token": "<|vision_start|>",
+  "vision_eos_token": "<|vision_end|>",
+  "audio_bos_token": "<|audio_start|>",
+  "audio_eos_token": "<|audio_end|>"
+}

vocab.json ADDED Viewed

The diff for this file is too large to render. See raw diff