voice: add Marvis TTS 250m v0.2 (MLX 8bit/4bit) + Kyutai Mimi codec (CC-BY-4.0)
This commit is contained in:
parent
4cea3f7301
commit
5247c06789
38 changed files with 1657 additions and 0 deletions
2
.gitattributes
vendored
2
.gitattributes
vendored
|
|
@ -11,3 +11,5 @@ tokenizer.json filter=lfs diff=lfs merge=lfs -text
|
||||||
vocab.json filter=lfs diff=lfs merge=lfs -text
|
vocab.json filter=lfs diff=lfs merge=lfs -text
|
||||||
merges.txt filter=lfs diff=lfs merge=lfs -text
|
merges.txt filter=lfs diff=lfs merge=lfs -text
|
||||||
*.litertlm filter=lfs diff=lfs merge=lfs -text
|
*.litertlm filter=lfs diff=lfs merge=lfs -text
|
||||||
|
voice/**/*.safetensors filter=lfs diff=lfs merge=lfs -text
|
||||||
|
voice/**/*.wav filter=lfs diff=lfs merge=lfs -text
|
||||||
|
|
|
||||||
BIN
voice/codec/kyutai/mimi/tokenizer-e351c8d8-checkpoint125.safetensors
(Stored with Git LFS)
Normal file
BIN
voice/codec/kyutai/mimi/tokenizer-e351c8d8-checkpoint125.safetensors
(Stored with Git LFS)
Normal file
Binary file not shown.
28
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/README.md
Executable file
28
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/README.md
Executable file
|
|
@ -0,0 +1,28 @@
|
||||||
|
---
|
||||||
|
license: apache-2.0
|
||||||
|
datasets:
|
||||||
|
- amphion/Emilia-Dataset
|
||||||
|
language:
|
||||||
|
- en
|
||||||
|
- fr
|
||||||
|
- de
|
||||||
|
library_name: transformers
|
||||||
|
tags:
|
||||||
|
- mlx
|
||||||
|
- mlx-audio
|
||||||
|
- transformers
|
||||||
|
- mlx
|
||||||
|
---
|
||||||
|
|
||||||
|
# Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit
|
||||||
|
This model was converted to MLX format from [`Marvis-AI/marvis-tts-250m-v0.2`](https://huggingface.co/Marvis-AI/marvis-tts-250m-v0.2) using mlx-audio version **0.2.6**.
|
||||||
|
Refer to the [original model card](https://huggingface.co/Marvis-AI/marvis-tts-250m-v0.2) for more details on the model.
|
||||||
|
## Use with mlx
|
||||||
|
|
||||||
|
```bash
|
||||||
|
pip install -U mlx-audio
|
||||||
|
```
|
||||||
|
|
||||||
|
```bash
|
||||||
|
python -m mlx_audio.tts.generate --model Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit --text "Describe this image."
|
||||||
|
```
|
||||||
307
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/config.json
Executable file
307
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/config.json
Executable file
|
|
@ -0,0 +1,307 @@
|
||||||
|
{
|
||||||
|
"add_cross_attention": false,
|
||||||
|
"architectures": [
|
||||||
|
"CsmForConditionalGeneration"
|
||||||
|
],
|
||||||
|
"attention_bias": false,
|
||||||
|
"attention_dropout": 0.0,
|
||||||
|
"audio_eos_token_id": 128003,
|
||||||
|
"audio_num_codebooks": 32,
|
||||||
|
"audio_token_id": 128002,
|
||||||
|
"audio_vocab_size": 2051,
|
||||||
|
"backbone_flavor": "llama-250M",
|
||||||
|
"bad_words_ids": null,
|
||||||
|
"begin_suppress_tokens": null,
|
||||||
|
"bos_token_id": 128000,
|
||||||
|
"chunk_size_feed_forward": 0,
|
||||||
|
"codebook_eos_token_id": 0,
|
||||||
|
"codebook_pad_token_id": 2050,
|
||||||
|
"codec_config": {
|
||||||
|
"sampling_rate": 24000,
|
||||||
|
"audio_channels": 1,
|
||||||
|
"hidden_size": 512,
|
||||||
|
"num_filters": 64,
|
||||||
|
"num_residual_layers": 1,
|
||||||
|
"upsampling_ratios": [
|
||||||
|
8,
|
||||||
|
6,
|
||||||
|
5,
|
||||||
|
4
|
||||||
|
],
|
||||||
|
"kernel_size": 7,
|
||||||
|
"last_kernel_size": 3,
|
||||||
|
"residual_kernel_size": 3,
|
||||||
|
"dilation_growth_rate": 2,
|
||||||
|
"use_causal_conv": true,
|
||||||
|
"pad_mode": "constant",
|
||||||
|
"compress": 2,
|
||||||
|
"trim_right_ratio": 1.0,
|
||||||
|
"codebook_size": 2048,
|
||||||
|
"codebook_dim": 256,
|
||||||
|
"num_quantizers": 32,
|
||||||
|
"use_conv_shortcut": false,
|
||||||
|
"vector_quantization_hidden_dimension": 256,
|
||||||
|
"upsample_groups": 512,
|
||||||
|
"num_hidden_layers": 8,
|
||||||
|
"intermediate_size": 2048,
|
||||||
|
"num_attention_heads": 8,
|
||||||
|
"num_key_value_heads": 8,
|
||||||
|
"hidden_act": "gelu",
|
||||||
|
"max_position_embeddings": 8000,
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"norm_eps": 1e-05,
|
||||||
|
"use_cache": false,
|
||||||
|
"use_streaming": false,
|
||||||
|
"rope_theta": 10000.0,
|
||||||
|
"sliding_window": 250,
|
||||||
|
"attention_dropout": 0.0,
|
||||||
|
"head_dim": 64,
|
||||||
|
"layer_scale_initial_scale": 0.01,
|
||||||
|
"attention_bias": false,
|
||||||
|
"_frame_rate": 12.5,
|
||||||
|
"num_semantic_quantizers": 1,
|
||||||
|
"return_dict": true,
|
||||||
|
"output_hidden_states": false,
|
||||||
|
"torchscript": false,
|
||||||
|
"dtype": "float32",
|
||||||
|
"pruned_heads": {},
|
||||||
|
"tie_word_embeddings": true,
|
||||||
|
"chunk_size_feed_forward": 0,
|
||||||
|
"is_encoder_decoder": false,
|
||||||
|
"is_decoder": false,
|
||||||
|
"cross_attention_hidden_size": null,
|
||||||
|
"add_cross_attention": false,
|
||||||
|
"tie_encoder_decoder": false,
|
||||||
|
"architectures": [
|
||||||
|
"MimiModel"
|
||||||
|
],
|
||||||
|
"finetuning_task": null,
|
||||||
|
"id2label": {
|
||||||
|
"0": "LABEL_0",
|
||||||
|
"1": "LABEL_1"
|
||||||
|
},
|
||||||
|
"label2id": {
|
||||||
|
"LABEL_0": 0,
|
||||||
|
"LABEL_1": 1
|
||||||
|
},
|
||||||
|
"task_specific_params": null,
|
||||||
|
"problem_type": null,
|
||||||
|
"tokenizer_class": null,
|
||||||
|
"prefix": null,
|
||||||
|
"bos_token_id": null,
|
||||||
|
"pad_token_id": null,
|
||||||
|
"eos_token_id": null,
|
||||||
|
"sep_token_id": null,
|
||||||
|
"decoder_start_token_id": null,
|
||||||
|
"max_length": 20,
|
||||||
|
"min_length": 0,
|
||||||
|
"do_sample": false,
|
||||||
|
"early_stopping": false,
|
||||||
|
"num_beams": 1,
|
||||||
|
"temperature": 1.0,
|
||||||
|
"top_k": 50,
|
||||||
|
"top_p": 1.0,
|
||||||
|
"typical_p": 1.0,
|
||||||
|
"repetition_penalty": 1.0,
|
||||||
|
"length_penalty": 1.0,
|
||||||
|
"no_repeat_ngram_size": 0,
|
||||||
|
"encoder_no_repeat_ngram_size": 0,
|
||||||
|
"bad_words_ids": null,
|
||||||
|
"num_return_sequences": 1,
|
||||||
|
"output_scores": false,
|
||||||
|
"return_dict_in_generate": false,
|
||||||
|
"forced_bos_token_id": null,
|
||||||
|
"forced_eos_token_id": null,
|
||||||
|
"remove_invalid_values": false,
|
||||||
|
"exponential_decay_length_penalty": null,
|
||||||
|
"suppress_tokens": null,
|
||||||
|
"begin_suppress_tokens": null,
|
||||||
|
"num_beam_groups": 1,
|
||||||
|
"diversity_penalty": 0.0,
|
||||||
|
"_name_or_path": "kyutai/mimi",
|
||||||
|
"normalize": false,
|
||||||
|
"tf_legacy_loss": false,
|
||||||
|
"use_bfloat16": false,
|
||||||
|
"model_type": "mimi",
|
||||||
|
"output_attentions": false
|
||||||
|
},
|
||||||
|
"cross_attention_hidden_size": null,
|
||||||
|
"decoder_flavor": "llama-60M",
|
||||||
|
"decoder_start_token_id": null,
|
||||||
|
"depth_decoder_config": {
|
||||||
|
"return_dict": true,
|
||||||
|
"output_hidden_states": false,
|
||||||
|
"torchscript": false,
|
||||||
|
"dtype": null,
|
||||||
|
"pruned_heads": {},
|
||||||
|
"tie_word_embeddings": false,
|
||||||
|
"chunk_size_feed_forward": 0,
|
||||||
|
"is_encoder_decoder": false,
|
||||||
|
"is_decoder": false,
|
||||||
|
"cross_attention_hidden_size": null,
|
||||||
|
"add_cross_attention": false,
|
||||||
|
"tie_encoder_decoder": false,
|
||||||
|
"architectures": null,
|
||||||
|
"finetuning_task": null,
|
||||||
|
"id2label": {
|
||||||
|
"0": "LABEL_0",
|
||||||
|
"1": "LABEL_1"
|
||||||
|
},
|
||||||
|
"label2id": {
|
||||||
|
"LABEL_0": 0,
|
||||||
|
"LABEL_1": 1
|
||||||
|
},
|
||||||
|
"task_specific_params": null,
|
||||||
|
"problem_type": null,
|
||||||
|
"tokenizer_class": null,
|
||||||
|
"prefix": null,
|
||||||
|
"bos_token_id": null,
|
||||||
|
"pad_token_id": null,
|
||||||
|
"eos_token_id": null,
|
||||||
|
"sep_token_id": null,
|
||||||
|
"decoder_start_token_id": null,
|
||||||
|
"max_length": 20,
|
||||||
|
"min_length": 0,
|
||||||
|
"do_sample": false,
|
||||||
|
"early_stopping": false,
|
||||||
|
"num_beams": 1,
|
||||||
|
"temperature": 1.0,
|
||||||
|
"top_k": 50,
|
||||||
|
"top_p": 1.0,
|
||||||
|
"typical_p": 1.0,
|
||||||
|
"repetition_penalty": 1.0,
|
||||||
|
"length_penalty": 1.0,
|
||||||
|
"no_repeat_ngram_size": 0,
|
||||||
|
"encoder_no_repeat_ngram_size": 0,
|
||||||
|
"bad_words_ids": null,
|
||||||
|
"num_return_sequences": 1,
|
||||||
|
"output_scores": false,
|
||||||
|
"return_dict_in_generate": false,
|
||||||
|
"forced_bos_token_id": null,
|
||||||
|
"forced_eos_token_id": null,
|
||||||
|
"remove_invalid_values": false,
|
||||||
|
"exponential_decay_length_penalty": null,
|
||||||
|
"suppress_tokens": null,
|
||||||
|
"begin_suppress_tokens": null,
|
||||||
|
"num_beam_groups": 1,
|
||||||
|
"diversity_penalty": 0.0,
|
||||||
|
"_name_or_path": "",
|
||||||
|
"model_type": "csm_depth_decoder_model",
|
||||||
|
"tf_legacy_loss": false,
|
||||||
|
"use_bfloat16": false,
|
||||||
|
"num_codebooks": 32,
|
||||||
|
"vocab_size": 2051,
|
||||||
|
"backbone_hidden_size": 1536,
|
||||||
|
"max_position_embeddings": 33,
|
||||||
|
"hidden_size": 1024,
|
||||||
|
"intermediate_size": 4096,
|
||||||
|
"num_hidden_layers": 4,
|
||||||
|
"num_attention_heads": 8,
|
||||||
|
"num_key_value_heads": 2,
|
||||||
|
"hidden_act": "silu",
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"rms_norm_eps": 1e-05,
|
||||||
|
"use_cache": true,
|
||||||
|
"rope_theta": 500000,
|
||||||
|
"rope_scaling": {
|
||||||
|
"factor": 32.0,
|
||||||
|
"high_freq_factor": 0.0078125,
|
||||||
|
"low_freq_factor": 0.001953125,
|
||||||
|
"original_max_position_embeddings": 16,
|
||||||
|
"rope_type": "llama3"
|
||||||
|
},
|
||||||
|
"attention_bias": false,
|
||||||
|
"attention_dropout": 0.0,
|
||||||
|
"mlp_bias": false,
|
||||||
|
"head_dim": 128,
|
||||||
|
"output_attentions": false
|
||||||
|
},
|
||||||
|
"diversity_penalty": 0.0,
|
||||||
|
"do_sample": false,
|
||||||
|
"dtype": null,
|
||||||
|
"early_stopping": false,
|
||||||
|
"encoder_no_repeat_ngram_size": 0,
|
||||||
|
"eos_token_id": null,
|
||||||
|
"exponential_decay_length_penalty": null,
|
||||||
|
"finetuning_task": null,
|
||||||
|
"forced_bos_token_id": null,
|
||||||
|
"forced_eos_token_id": null,
|
||||||
|
"head_dim": 128,
|
||||||
|
"hidden_act": "silu",
|
||||||
|
"hidden_size": 1536,
|
||||||
|
"id2label": {
|
||||||
|
"0": "LABEL_0",
|
||||||
|
"1": "LABEL_1"
|
||||||
|
},
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"intermediate_size": 8192,
|
||||||
|
"is_decoder": false,
|
||||||
|
"is_encoder_decoder": false,
|
||||||
|
"label2id": {
|
||||||
|
"LABEL_0": 0,
|
||||||
|
"LABEL_1": 1
|
||||||
|
},
|
||||||
|
"length_penalty": 1.0,
|
||||||
|
"max_length": 20,
|
||||||
|
"max_position_embeddings": 2048,
|
||||||
|
"min_length": 0,
|
||||||
|
"mlp_bias": false,
|
||||||
|
"model_type": "csm",
|
||||||
|
"no_repeat_ngram_size": 0,
|
||||||
|
"num_attention_heads": 12,
|
||||||
|
"num_beam_groups": 1,
|
||||||
|
"num_beams": 1,
|
||||||
|
"num_codebooks": 32,
|
||||||
|
"num_hidden_layers": 6,
|
||||||
|
"num_key_value_heads": 3,
|
||||||
|
"num_return_sequences": 1,
|
||||||
|
"output_attentions": false,
|
||||||
|
"output_hidden_states": false,
|
||||||
|
"output_scores": false,
|
||||||
|
"pad_token_id": 128002,
|
||||||
|
"prefix": null,
|
||||||
|
"problem_type": null,
|
||||||
|
"pruned_heads": {},
|
||||||
|
"quantization": {
|
||||||
|
"group_size": 64,
|
||||||
|
"bits": 4,
|
||||||
|
"mode": "affine"
|
||||||
|
},
|
||||||
|
"quantization_config": {
|
||||||
|
"group_size": 64,
|
||||||
|
"bits": 4,
|
||||||
|
"mode": "affine"
|
||||||
|
},
|
||||||
|
"remove_invalid_values": false,
|
||||||
|
"repetition_penalty": 1.0,
|
||||||
|
"return_dict": true,
|
||||||
|
"return_dict_in_generate": false,
|
||||||
|
"rms_norm_eps": 1e-05,
|
||||||
|
"rope_scaling": {
|
||||||
|
"factor": 32.0,
|
||||||
|
"high_freq_factor": 0.5,
|
||||||
|
"low_freq_factor": 0.125,
|
||||||
|
"original_max_position_embeddings": 1024,
|
||||||
|
"rope_type": "llama3"
|
||||||
|
},
|
||||||
|
"rope_theta": 500000,
|
||||||
|
"sep_token_id": null,
|
||||||
|
"suppress_tokens": null,
|
||||||
|
"task_specific_params": null,
|
||||||
|
"temperature": 1.0,
|
||||||
|
"text_tokenizer": "Marvis-AI/marvis-tts-250m-v0.2",
|
||||||
|
"text_vocab_size": 49152,
|
||||||
|
"tf_legacy_loss": false,
|
||||||
|
"tie_codebooks_embeddings": true,
|
||||||
|
"tie_encoder_decoder": false,
|
||||||
|
"tie_word_embeddings": false,
|
||||||
|
"tokenizer_class": null,
|
||||||
|
"top_k": 50,
|
||||||
|
"top_p": 1.0,
|
||||||
|
"torchscript": false,
|
||||||
|
"transformers_version": "4.57.1",
|
||||||
|
"typical_p": 1.0,
|
||||||
|
"use_bfloat16": false,
|
||||||
|
"use_cache": true,
|
||||||
|
"vocab_size": 2051
|
||||||
|
}
|
||||||
12
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/generation_config.json
Executable file
12
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/generation_config.json
Executable file
|
|
@ -0,0 +1,12 @@
|
||||||
|
{
|
||||||
|
"bos_token_id": 1,
|
||||||
|
"depth_decoder__from_model_config": true,
|
||||||
|
"depth_decoder_do_sample": true,
|
||||||
|
"depth_decoder_temperature": 0.9,
|
||||||
|
"depth_decoder_top_k": 50,
|
||||||
|
"do_sample": true,
|
||||||
|
"max_new_tokens": 125,
|
||||||
|
"pad_token_id": 0,
|
||||||
|
"temperature": 0.9,
|
||||||
|
"transformers_version": "4.54.1"
|
||||||
|
}
|
||||||
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/merges.txt
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/merges.txt
(Stored with Git LFS)
Executable file
Binary file not shown.
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/model.safetensors
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/model.safetensors
(Stored with Git LFS)
Executable file
Binary file not shown.
253
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/model.safetensors.index.json
Executable file
253
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/model.safetensors.index.json
Executable file
|
|
@ -0,0 +1,253 @@
|
||||||
|
{
|
||||||
|
"metadata": {
|
||||||
|
"total_size": 413620768,
|
||||||
|
"total_parameters": 599911265
|
||||||
|
},
|
||||||
|
"weight_map": {
|
||||||
|
"model.audio_embeddings.biases": "model.safetensors",
|
||||||
|
"model.audio_embeddings.scales": "model.safetensors",
|
||||||
|
"model.audio_embeddings.weight": "model.safetensors",
|
||||||
|
"model.audio_head": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.norm.weight": "model.safetensors",
|
||||||
|
"model.codebook0_head.biases": "model.safetensors",
|
||||||
|
"model.codebook0_head.scales": "model.safetensors",
|
||||||
|
"model.codebook0_head.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.norm.weight": "model.safetensors",
|
||||||
|
"model.projection.biases": "model.safetensors",
|
||||||
|
"model.projection.scales": "model.safetensors",
|
||||||
|
"model.projection.weight": "model.safetensors",
|
||||||
|
"model.text_embeddings.biases": "model.safetensors",
|
||||||
|
"model.text_embeddings.scales": "model.safetensors",
|
||||||
|
"model.text_embeddings.weight": "model.safetensors"
|
||||||
|
}
|
||||||
|
}
|
||||||
|
|
@ -0,0 +1 @@
|
||||||
|
Coffee's story likely begins in Ethiopia, where legend tells of a goat herder named Kaldi who noticed his goats became energetic after eating red berries from a particular bush. Curious, he tried them himself, and felt invigorated.
|
||||||
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_a.wav
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_a.wav
(Stored with Git LFS)
Executable file
Binary file not shown.
|
|
@ -0,0 +1 @@
|
||||||
|
Coffee's story likely begins in Ethiopia, where legend tells of a goat herder named Kaldi who noticed his goats became energetic after eating red berries from a particular bush. Curious, he tried them himself, and felt invigorated.
|
||||||
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_b.wav
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_b.wav
(Stored with Git LFS)
Executable file
Binary file not shown.
|
|
@ -0,0 +1 @@
|
||||||
|
Ich werde bald mehrere Sprachen sprechen, darunter auch Deutsch.
|
||||||
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_de.wav
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_de.wav
(Stored with Git LFS)
Executable file
Binary file not shown.
|
|
@ -0,0 +1 @@
|
||||||
|
J'ai toujours cru qu’un étrange voleur joyeux mangeait rapidement cinq gâteaux exquis près du vieux phare.
|
||||||
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_fr.wav
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_fr.wav
(Stored with Git LFS)
Executable file
Binary file not shown.
30
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/special_tokens_map.json
Executable file
30
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/special_tokens_map.json
Executable file
|
|
@ -0,0 +1,30 @@
|
||||||
|
{
|
||||||
|
"additional_special_tokens": [
|
||||||
|
"<|endoftext|>",
|
||||||
|
"<|im_start|>",
|
||||||
|
"<|im_end|>",
|
||||||
|
"<repo_name>",
|
||||||
|
"<reponame>",
|
||||||
|
"<file_sep>",
|
||||||
|
"<filename>",
|
||||||
|
"<gh_stars>",
|
||||||
|
"<issue_start>",
|
||||||
|
"<issue_comment>",
|
||||||
|
"<issue_closed>",
|
||||||
|
"<jupyter_start>",
|
||||||
|
"<jupyter_text>",
|
||||||
|
"<jupyter_code>",
|
||||||
|
"<jupyter_output>",
|
||||||
|
"<jupyter_script>",
|
||||||
|
"<empty_output>"
|
||||||
|
],
|
||||||
|
"bos_token": "<|im_start|>",
|
||||||
|
"eos_token": "<|im_end|>",
|
||||||
|
"unk_token": {
|
||||||
|
"content": "<|endoftext|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
}
|
||||||
|
}
|
||||||
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/tokenizer.json
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/tokenizer.json
(Stored with Git LFS)
Executable file
Binary file not shown.
168
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/tokenizer_config.json
Executable file
168
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/tokenizer_config.json
Executable file
|
|
@ -0,0 +1,168 @@
|
||||||
|
{
|
||||||
|
"add_prefix_space": false,
|
||||||
|
"added_tokens_decoder": {
|
||||||
|
"0": {
|
||||||
|
"content": "<|endoftext|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"1": {
|
||||||
|
"content": "<|im_start|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"2": {
|
||||||
|
"content": "<|im_end|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"3": {
|
||||||
|
"content": "<repo_name>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"4": {
|
||||||
|
"content": "<reponame>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"5": {
|
||||||
|
"content": "<file_sep>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"6": {
|
||||||
|
"content": "<filename>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"7": {
|
||||||
|
"content": "<gh_stars>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"8": {
|
||||||
|
"content": "<issue_start>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"9": {
|
||||||
|
"content": "<issue_comment>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"10": {
|
||||||
|
"content": "<issue_closed>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"11": {
|
||||||
|
"content": "<jupyter_start>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"12": {
|
||||||
|
"content": "<jupyter_text>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"13": {
|
||||||
|
"content": "<jupyter_code>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"14": {
|
||||||
|
"content": "<jupyter_output>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"15": {
|
||||||
|
"content": "<jupyter_script>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"16": {
|
||||||
|
"content": "<empty_output>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"additional_special_tokens": [
|
||||||
|
"<|endoftext|>",
|
||||||
|
"<|im_start|>",
|
||||||
|
"<|im_end|>",
|
||||||
|
"<repo_name>",
|
||||||
|
"<reponame>",
|
||||||
|
"<file_sep>",
|
||||||
|
"<filename>",
|
||||||
|
"<gh_stars>",
|
||||||
|
"<issue_start>",
|
||||||
|
"<issue_comment>",
|
||||||
|
"<issue_closed>",
|
||||||
|
"<jupyter_start>",
|
||||||
|
"<jupyter_text>",
|
||||||
|
"<jupyter_code>",
|
||||||
|
"<jupyter_output>",
|
||||||
|
"<jupyter_script>",
|
||||||
|
"<empty_output>"
|
||||||
|
],
|
||||||
|
"bos_token": "<|im_start|>",
|
||||||
|
"clean_up_tokenization_spaces": false,
|
||||||
|
"eos_token": "<|im_end|>",
|
||||||
|
"extra_special_tokens": {},
|
||||||
|
"model_max_length": 8192,
|
||||||
|
"tokenizer_class": "GPT2Tokenizer",
|
||||||
|
"unk_token": "<|endoftext|>",
|
||||||
|
"vocab_size": 49152
|
||||||
|
}
|
||||||
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/vocab.json
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/vocab.json
(Stored with Git LFS)
Executable file
Binary file not shown.
28
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/README.md
Executable file
28
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/README.md
Executable file
|
|
@ -0,0 +1,28 @@
|
||||||
|
---
|
||||||
|
license: apache-2.0
|
||||||
|
datasets:
|
||||||
|
- amphion/Emilia-Dataset
|
||||||
|
language:
|
||||||
|
- en
|
||||||
|
- fr
|
||||||
|
- de
|
||||||
|
library_name: transformers
|
||||||
|
tags:
|
||||||
|
- mlx
|
||||||
|
- mlx-audio
|
||||||
|
- transformers
|
||||||
|
- mlx
|
||||||
|
---
|
||||||
|
|
||||||
|
# Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit
|
||||||
|
This model was converted to MLX format from [`Marvis-AI/marvis-tts-250m-v0.2`](https://huggingface.co/Marvis-AI/marvis-tts-250m-v0.2) using mlx-audio version **0.2.6**.
|
||||||
|
Refer to the [original model card](https://huggingface.co/Marvis-AI/marvis-tts-250m-v0.2) for more details on the model.
|
||||||
|
## Use with mlx
|
||||||
|
|
||||||
|
```bash
|
||||||
|
pip install -U mlx-audio
|
||||||
|
```
|
||||||
|
|
||||||
|
```bash
|
||||||
|
python -m mlx_audio.tts.generate --model Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit --text "Describe this image."
|
||||||
|
```
|
||||||
307
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/config.json
Executable file
307
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/config.json
Executable file
|
|
@ -0,0 +1,307 @@
|
||||||
|
{
|
||||||
|
"add_cross_attention": false,
|
||||||
|
"architectures": [
|
||||||
|
"CsmForConditionalGeneration"
|
||||||
|
],
|
||||||
|
"attention_bias": false,
|
||||||
|
"attention_dropout": 0.0,
|
||||||
|
"audio_eos_token_id": 128003,
|
||||||
|
"audio_num_codebooks": 32,
|
||||||
|
"audio_token_id": 128002,
|
||||||
|
"audio_vocab_size": 2051,
|
||||||
|
"backbone_flavor": "llama-250M",
|
||||||
|
"bad_words_ids": null,
|
||||||
|
"begin_suppress_tokens": null,
|
||||||
|
"bos_token_id": 128000,
|
||||||
|
"chunk_size_feed_forward": 0,
|
||||||
|
"codebook_eos_token_id": 0,
|
||||||
|
"codebook_pad_token_id": 2050,
|
||||||
|
"codec_config": {
|
||||||
|
"sampling_rate": 24000,
|
||||||
|
"audio_channels": 1,
|
||||||
|
"hidden_size": 512,
|
||||||
|
"num_filters": 64,
|
||||||
|
"num_residual_layers": 1,
|
||||||
|
"upsampling_ratios": [
|
||||||
|
8,
|
||||||
|
6,
|
||||||
|
5,
|
||||||
|
4
|
||||||
|
],
|
||||||
|
"kernel_size": 7,
|
||||||
|
"last_kernel_size": 3,
|
||||||
|
"residual_kernel_size": 3,
|
||||||
|
"dilation_growth_rate": 2,
|
||||||
|
"use_causal_conv": true,
|
||||||
|
"pad_mode": "constant",
|
||||||
|
"compress": 2,
|
||||||
|
"trim_right_ratio": 1.0,
|
||||||
|
"codebook_size": 2048,
|
||||||
|
"codebook_dim": 256,
|
||||||
|
"num_quantizers": 32,
|
||||||
|
"use_conv_shortcut": false,
|
||||||
|
"vector_quantization_hidden_dimension": 256,
|
||||||
|
"upsample_groups": 512,
|
||||||
|
"num_hidden_layers": 8,
|
||||||
|
"intermediate_size": 2048,
|
||||||
|
"num_attention_heads": 8,
|
||||||
|
"num_key_value_heads": 8,
|
||||||
|
"hidden_act": "gelu",
|
||||||
|
"max_position_embeddings": 8000,
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"norm_eps": 1e-05,
|
||||||
|
"use_cache": false,
|
||||||
|
"use_streaming": false,
|
||||||
|
"rope_theta": 10000.0,
|
||||||
|
"sliding_window": 250,
|
||||||
|
"attention_dropout": 0.0,
|
||||||
|
"head_dim": 64,
|
||||||
|
"layer_scale_initial_scale": 0.01,
|
||||||
|
"attention_bias": false,
|
||||||
|
"_frame_rate": 12.5,
|
||||||
|
"num_semantic_quantizers": 1,
|
||||||
|
"return_dict": true,
|
||||||
|
"output_hidden_states": false,
|
||||||
|
"torchscript": false,
|
||||||
|
"dtype": "float32",
|
||||||
|
"pruned_heads": {},
|
||||||
|
"tie_word_embeddings": true,
|
||||||
|
"chunk_size_feed_forward": 0,
|
||||||
|
"is_encoder_decoder": false,
|
||||||
|
"is_decoder": false,
|
||||||
|
"cross_attention_hidden_size": null,
|
||||||
|
"add_cross_attention": false,
|
||||||
|
"tie_encoder_decoder": false,
|
||||||
|
"architectures": [
|
||||||
|
"MimiModel"
|
||||||
|
],
|
||||||
|
"finetuning_task": null,
|
||||||
|
"id2label": {
|
||||||
|
"0": "LABEL_0",
|
||||||
|
"1": "LABEL_1"
|
||||||
|
},
|
||||||
|
"label2id": {
|
||||||
|
"LABEL_0": 0,
|
||||||
|
"LABEL_1": 1
|
||||||
|
},
|
||||||
|
"task_specific_params": null,
|
||||||
|
"problem_type": null,
|
||||||
|
"tokenizer_class": null,
|
||||||
|
"prefix": null,
|
||||||
|
"bos_token_id": null,
|
||||||
|
"pad_token_id": null,
|
||||||
|
"eos_token_id": null,
|
||||||
|
"sep_token_id": null,
|
||||||
|
"decoder_start_token_id": null,
|
||||||
|
"max_length": 20,
|
||||||
|
"min_length": 0,
|
||||||
|
"do_sample": false,
|
||||||
|
"early_stopping": false,
|
||||||
|
"num_beams": 1,
|
||||||
|
"temperature": 1.0,
|
||||||
|
"top_k": 50,
|
||||||
|
"top_p": 1.0,
|
||||||
|
"typical_p": 1.0,
|
||||||
|
"repetition_penalty": 1.0,
|
||||||
|
"length_penalty": 1.0,
|
||||||
|
"no_repeat_ngram_size": 0,
|
||||||
|
"encoder_no_repeat_ngram_size": 0,
|
||||||
|
"bad_words_ids": null,
|
||||||
|
"num_return_sequences": 1,
|
||||||
|
"output_scores": false,
|
||||||
|
"return_dict_in_generate": false,
|
||||||
|
"forced_bos_token_id": null,
|
||||||
|
"forced_eos_token_id": null,
|
||||||
|
"remove_invalid_values": false,
|
||||||
|
"exponential_decay_length_penalty": null,
|
||||||
|
"suppress_tokens": null,
|
||||||
|
"begin_suppress_tokens": null,
|
||||||
|
"num_beam_groups": 1,
|
||||||
|
"diversity_penalty": 0.0,
|
||||||
|
"_name_or_path": "kyutai/mimi",
|
||||||
|
"normalize": false,
|
||||||
|
"tf_legacy_loss": false,
|
||||||
|
"use_bfloat16": false,
|
||||||
|
"model_type": "mimi",
|
||||||
|
"output_attentions": false
|
||||||
|
},
|
||||||
|
"cross_attention_hidden_size": null,
|
||||||
|
"decoder_flavor": "llama-60M",
|
||||||
|
"decoder_start_token_id": null,
|
||||||
|
"depth_decoder_config": {
|
||||||
|
"return_dict": true,
|
||||||
|
"output_hidden_states": false,
|
||||||
|
"torchscript": false,
|
||||||
|
"dtype": null,
|
||||||
|
"pruned_heads": {},
|
||||||
|
"tie_word_embeddings": false,
|
||||||
|
"chunk_size_feed_forward": 0,
|
||||||
|
"is_encoder_decoder": false,
|
||||||
|
"is_decoder": false,
|
||||||
|
"cross_attention_hidden_size": null,
|
||||||
|
"add_cross_attention": false,
|
||||||
|
"tie_encoder_decoder": false,
|
||||||
|
"architectures": null,
|
||||||
|
"finetuning_task": null,
|
||||||
|
"id2label": {
|
||||||
|
"0": "LABEL_0",
|
||||||
|
"1": "LABEL_1"
|
||||||
|
},
|
||||||
|
"label2id": {
|
||||||
|
"LABEL_0": 0,
|
||||||
|
"LABEL_1": 1
|
||||||
|
},
|
||||||
|
"task_specific_params": null,
|
||||||
|
"problem_type": null,
|
||||||
|
"tokenizer_class": null,
|
||||||
|
"prefix": null,
|
||||||
|
"bos_token_id": null,
|
||||||
|
"pad_token_id": null,
|
||||||
|
"eos_token_id": null,
|
||||||
|
"sep_token_id": null,
|
||||||
|
"decoder_start_token_id": null,
|
||||||
|
"max_length": 20,
|
||||||
|
"min_length": 0,
|
||||||
|
"do_sample": false,
|
||||||
|
"early_stopping": false,
|
||||||
|
"num_beams": 1,
|
||||||
|
"temperature": 1.0,
|
||||||
|
"top_k": 50,
|
||||||
|
"top_p": 1.0,
|
||||||
|
"typical_p": 1.0,
|
||||||
|
"repetition_penalty": 1.0,
|
||||||
|
"length_penalty": 1.0,
|
||||||
|
"no_repeat_ngram_size": 0,
|
||||||
|
"encoder_no_repeat_ngram_size": 0,
|
||||||
|
"bad_words_ids": null,
|
||||||
|
"num_return_sequences": 1,
|
||||||
|
"output_scores": false,
|
||||||
|
"return_dict_in_generate": false,
|
||||||
|
"forced_bos_token_id": null,
|
||||||
|
"forced_eos_token_id": null,
|
||||||
|
"remove_invalid_values": false,
|
||||||
|
"exponential_decay_length_penalty": null,
|
||||||
|
"suppress_tokens": null,
|
||||||
|
"begin_suppress_tokens": null,
|
||||||
|
"num_beam_groups": 1,
|
||||||
|
"diversity_penalty": 0.0,
|
||||||
|
"_name_or_path": "",
|
||||||
|
"model_type": "csm_depth_decoder_model",
|
||||||
|
"tf_legacy_loss": false,
|
||||||
|
"use_bfloat16": false,
|
||||||
|
"num_codebooks": 32,
|
||||||
|
"vocab_size": 2051,
|
||||||
|
"backbone_hidden_size": 1536,
|
||||||
|
"max_position_embeddings": 33,
|
||||||
|
"hidden_size": 1024,
|
||||||
|
"intermediate_size": 4096,
|
||||||
|
"num_hidden_layers": 4,
|
||||||
|
"num_attention_heads": 8,
|
||||||
|
"num_key_value_heads": 2,
|
||||||
|
"hidden_act": "silu",
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"rms_norm_eps": 1e-05,
|
||||||
|
"use_cache": true,
|
||||||
|
"rope_theta": 500000,
|
||||||
|
"rope_scaling": {
|
||||||
|
"factor": 32.0,
|
||||||
|
"high_freq_factor": 0.0078125,
|
||||||
|
"low_freq_factor": 0.001953125,
|
||||||
|
"original_max_position_embeddings": 16,
|
||||||
|
"rope_type": "llama3"
|
||||||
|
},
|
||||||
|
"attention_bias": false,
|
||||||
|
"attention_dropout": 0.0,
|
||||||
|
"mlp_bias": false,
|
||||||
|
"head_dim": 128,
|
||||||
|
"output_attentions": false
|
||||||
|
},
|
||||||
|
"diversity_penalty": 0.0,
|
||||||
|
"do_sample": false,
|
||||||
|
"dtype": null,
|
||||||
|
"early_stopping": false,
|
||||||
|
"encoder_no_repeat_ngram_size": 0,
|
||||||
|
"eos_token_id": null,
|
||||||
|
"exponential_decay_length_penalty": null,
|
||||||
|
"finetuning_task": null,
|
||||||
|
"forced_bos_token_id": null,
|
||||||
|
"forced_eos_token_id": null,
|
||||||
|
"head_dim": 128,
|
||||||
|
"hidden_act": "silu",
|
||||||
|
"hidden_size": 1536,
|
||||||
|
"id2label": {
|
||||||
|
"0": "LABEL_0",
|
||||||
|
"1": "LABEL_1"
|
||||||
|
},
|
||||||
|
"initializer_range": 0.02,
|
||||||
|
"intermediate_size": 8192,
|
||||||
|
"is_decoder": false,
|
||||||
|
"is_encoder_decoder": false,
|
||||||
|
"label2id": {
|
||||||
|
"LABEL_0": 0,
|
||||||
|
"LABEL_1": 1
|
||||||
|
},
|
||||||
|
"length_penalty": 1.0,
|
||||||
|
"max_length": 20,
|
||||||
|
"max_position_embeddings": 2048,
|
||||||
|
"min_length": 0,
|
||||||
|
"mlp_bias": false,
|
||||||
|
"model_type": "csm",
|
||||||
|
"no_repeat_ngram_size": 0,
|
||||||
|
"num_attention_heads": 12,
|
||||||
|
"num_beam_groups": 1,
|
||||||
|
"num_beams": 1,
|
||||||
|
"num_codebooks": 32,
|
||||||
|
"num_hidden_layers": 6,
|
||||||
|
"num_key_value_heads": 3,
|
||||||
|
"num_return_sequences": 1,
|
||||||
|
"output_attentions": false,
|
||||||
|
"output_hidden_states": false,
|
||||||
|
"output_scores": false,
|
||||||
|
"pad_token_id": 128002,
|
||||||
|
"prefix": null,
|
||||||
|
"problem_type": null,
|
||||||
|
"pruned_heads": {},
|
||||||
|
"quantization": {
|
||||||
|
"group_size": 64,
|
||||||
|
"bits": 8,
|
||||||
|
"mode": "affine"
|
||||||
|
},
|
||||||
|
"quantization_config": {
|
||||||
|
"group_size": 64,
|
||||||
|
"bits": 8,
|
||||||
|
"mode": "affine"
|
||||||
|
},
|
||||||
|
"remove_invalid_values": false,
|
||||||
|
"repetition_penalty": 1.0,
|
||||||
|
"return_dict": true,
|
||||||
|
"return_dict_in_generate": false,
|
||||||
|
"rms_norm_eps": 1e-05,
|
||||||
|
"rope_scaling": {
|
||||||
|
"factor": 32.0,
|
||||||
|
"high_freq_factor": 0.5,
|
||||||
|
"low_freq_factor": 0.125,
|
||||||
|
"original_max_position_embeddings": 1024,
|
||||||
|
"rope_type": "llama3"
|
||||||
|
},
|
||||||
|
"rope_theta": 500000,
|
||||||
|
"sep_token_id": null,
|
||||||
|
"suppress_tokens": null,
|
||||||
|
"task_specific_params": null,
|
||||||
|
"temperature": 1.0,
|
||||||
|
"text_tokenizer": "Marvis-AI/marvis-tts-250m-v0.2",
|
||||||
|
"text_vocab_size": 49152,
|
||||||
|
"tf_legacy_loss": false,
|
||||||
|
"tie_codebooks_embeddings": true,
|
||||||
|
"tie_encoder_decoder": false,
|
||||||
|
"tie_word_embeddings": false,
|
||||||
|
"tokenizer_class": null,
|
||||||
|
"top_k": 50,
|
||||||
|
"top_p": 1.0,
|
||||||
|
"torchscript": false,
|
||||||
|
"transformers_version": "4.57.1",
|
||||||
|
"typical_p": 1.0,
|
||||||
|
"use_bfloat16": false,
|
||||||
|
"use_cache": true,
|
||||||
|
"vocab_size": 2051
|
||||||
|
}
|
||||||
12
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/generation_config.json
Executable file
12
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/generation_config.json
Executable file
|
|
@ -0,0 +1,12 @@
|
||||||
|
{
|
||||||
|
"bos_token_id": 1,
|
||||||
|
"depth_decoder__from_model_config": true,
|
||||||
|
"depth_decoder_do_sample": true,
|
||||||
|
"depth_decoder_temperature": 0.9,
|
||||||
|
"depth_decoder_top_k": 50,
|
||||||
|
"do_sample": true,
|
||||||
|
"max_new_tokens": 125,
|
||||||
|
"pad_token_id": 0,
|
||||||
|
"temperature": 0.9,
|
||||||
|
"transformers_version": "4.54.1"
|
||||||
|
}
|
||||||
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/merges.txt
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/merges.txt
(Stored with Git LFS)
Executable file
Binary file not shown.
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/model.safetensors
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/model.safetensors
(Stored with Git LFS)
Executable file
Binary file not shown.
253
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/model.safetensors.index.json
Executable file
253
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/model.safetensors.index.json
Executable file
|
|
@ -0,0 +1,253 @@
|
||||||
|
{
|
||||||
|
"metadata": {
|
||||||
|
"total_size": 665486112,
|
||||||
|
"total_parameters": 599911265
|
||||||
|
},
|
||||||
|
"weight_map": {
|
||||||
|
"model.audio_embeddings.biases": "model.safetensors",
|
||||||
|
"model.audio_embeddings.scales": "model.safetensors",
|
||||||
|
"model.audio_embeddings.weight": "model.safetensors",
|
||||||
|
"model.audio_head": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.0.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.1.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.2.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.3.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.4.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.backbone.layers.5.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.backbone.norm.weight": "model.safetensors",
|
||||||
|
"model.codebook0_head.biases": "model.safetensors",
|
||||||
|
"model.codebook0_head.scales": "model.safetensors",
|
||||||
|
"model.codebook0_head.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.0.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.1.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.2.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.input_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.down_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.down_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.down_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.gate_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.gate_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.gate_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.up_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.up_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.mlp.up_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.post_attention_layernorm.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.k_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.k_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.k_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.o_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.o_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.o_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.q_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.q_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.q_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.v_proj.biases": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.v_proj.scales": "model.safetensors",
|
||||||
|
"model.decoder.layers.3.self_attn.v_proj.weight": "model.safetensors",
|
||||||
|
"model.decoder.norm.weight": "model.safetensors",
|
||||||
|
"model.projection.biases": "model.safetensors",
|
||||||
|
"model.projection.scales": "model.safetensors",
|
||||||
|
"model.projection.weight": "model.safetensors",
|
||||||
|
"model.text_embeddings.biases": "model.safetensors",
|
||||||
|
"model.text_embeddings.scales": "model.safetensors",
|
||||||
|
"model.text_embeddings.weight": "model.safetensors"
|
||||||
|
}
|
||||||
|
}
|
||||||
|
|
@ -0,0 +1 @@
|
||||||
|
Coffee's story likely begins in Ethiopia, where legend tells of a goat herder named Kaldi who noticed his goats became energetic after eating red berries from a particular bush. Curious, he tried them himself, and felt invigorated.
|
||||||
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_a.wav
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_a.wav
(Stored with Git LFS)
Executable file
Binary file not shown.
|
|
@ -0,0 +1 @@
|
||||||
|
Coffee's story likely begins in Ethiopia, where legend tells of a goat herder named Kaldi who noticed his goats became energetic after eating red berries from a particular bush. Curious, he tried them himself, and felt invigorated.
|
||||||
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_b.wav
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_b.wav
(Stored with Git LFS)
Executable file
Binary file not shown.
|
|
@ -0,0 +1 @@
|
||||||
|
Ich werde bald mehrere Sprachen sprechen, darunter auch Deutsch.
|
||||||
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_de.wav
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_de.wav
(Stored with Git LFS)
Executable file
Binary file not shown.
|
|
@ -0,0 +1 @@
|
||||||
|
J'ai toujours cru qu’un étrange voleur joyeux mangeait rapidement cinq gâteaux exquis près du vieux phare.
|
||||||
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_fr.wav
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_fr.wav
(Stored with Git LFS)
Executable file
Binary file not shown.
30
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/special_tokens_map.json
Executable file
30
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/special_tokens_map.json
Executable file
|
|
@ -0,0 +1,30 @@
|
||||||
|
{
|
||||||
|
"additional_special_tokens": [
|
||||||
|
"<|endoftext|>",
|
||||||
|
"<|im_start|>",
|
||||||
|
"<|im_end|>",
|
||||||
|
"<repo_name>",
|
||||||
|
"<reponame>",
|
||||||
|
"<file_sep>",
|
||||||
|
"<filename>",
|
||||||
|
"<gh_stars>",
|
||||||
|
"<issue_start>",
|
||||||
|
"<issue_comment>",
|
||||||
|
"<issue_closed>",
|
||||||
|
"<jupyter_start>",
|
||||||
|
"<jupyter_text>",
|
||||||
|
"<jupyter_code>",
|
||||||
|
"<jupyter_output>",
|
||||||
|
"<jupyter_script>",
|
||||||
|
"<empty_output>"
|
||||||
|
],
|
||||||
|
"bos_token": "<|im_start|>",
|
||||||
|
"eos_token": "<|im_end|>",
|
||||||
|
"unk_token": {
|
||||||
|
"content": "<|endoftext|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false
|
||||||
|
}
|
||||||
|
}
|
||||||
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/tokenizer.json
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/tokenizer.json
(Stored with Git LFS)
Executable file
Binary file not shown.
168
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/tokenizer_config.json
Executable file
168
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/tokenizer_config.json
Executable file
|
|
@ -0,0 +1,168 @@
|
||||||
|
{
|
||||||
|
"add_prefix_space": false,
|
||||||
|
"added_tokens_decoder": {
|
||||||
|
"0": {
|
||||||
|
"content": "<|endoftext|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"1": {
|
||||||
|
"content": "<|im_start|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"2": {
|
||||||
|
"content": "<|im_end|>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"3": {
|
||||||
|
"content": "<repo_name>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"4": {
|
||||||
|
"content": "<reponame>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"5": {
|
||||||
|
"content": "<file_sep>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"6": {
|
||||||
|
"content": "<filename>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"7": {
|
||||||
|
"content": "<gh_stars>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"8": {
|
||||||
|
"content": "<issue_start>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"9": {
|
||||||
|
"content": "<issue_comment>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"10": {
|
||||||
|
"content": "<issue_closed>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"11": {
|
||||||
|
"content": "<jupyter_start>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"12": {
|
||||||
|
"content": "<jupyter_text>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"13": {
|
||||||
|
"content": "<jupyter_code>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"14": {
|
||||||
|
"content": "<jupyter_output>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"15": {
|
||||||
|
"content": "<jupyter_script>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
},
|
||||||
|
"16": {
|
||||||
|
"content": "<empty_output>",
|
||||||
|
"lstrip": false,
|
||||||
|
"normalized": false,
|
||||||
|
"rstrip": false,
|
||||||
|
"single_word": false,
|
||||||
|
"special": true
|
||||||
|
}
|
||||||
|
},
|
||||||
|
"additional_special_tokens": [
|
||||||
|
"<|endoftext|>",
|
||||||
|
"<|im_start|>",
|
||||||
|
"<|im_end|>",
|
||||||
|
"<repo_name>",
|
||||||
|
"<reponame>",
|
||||||
|
"<file_sep>",
|
||||||
|
"<filename>",
|
||||||
|
"<gh_stars>",
|
||||||
|
"<issue_start>",
|
||||||
|
"<issue_comment>",
|
||||||
|
"<issue_closed>",
|
||||||
|
"<jupyter_start>",
|
||||||
|
"<jupyter_text>",
|
||||||
|
"<jupyter_code>",
|
||||||
|
"<jupyter_output>",
|
||||||
|
"<jupyter_script>",
|
||||||
|
"<empty_output>"
|
||||||
|
],
|
||||||
|
"bos_token": "<|im_start|>",
|
||||||
|
"clean_up_tokenization_spaces": false,
|
||||||
|
"eos_token": "<|im_end|>",
|
||||||
|
"extra_special_tokens": {},
|
||||||
|
"model_max_length": 8192,
|
||||||
|
"tokenizer_class": "GPT2Tokenizer",
|
||||||
|
"unk_token": "<|endoftext|>",
|
||||||
|
"vocab_size": 49152
|
||||||
|
}
|
||||||
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/vocab.json
(Stored with Git LFS)
Executable file
BIN
voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/vocab.json
(Stored with Git LFS)
Executable file
Binary file not shown.
Loading…
Add table
Add a link
Reference in a new issue