From 5247c067894322b774f90b93cbba5e5cd67708b6 Mon Sep 17 00:00:00 2001 From: hackit Date: Tue, 14 Jul 2026 21:57:21 +0000 Subject: [PATCH] voice: add Marvis TTS 250m v0.2 (MLX 8bit/4bit) + Kyutai Mimi codec (CC-BY-4.0) --- .gitattributes | 2 + ...kenizer-e351c8d8-checkpoint125.safetensors | 3 + .../marvis-tts-250m-v0.2-MLX-4bit/README.md | 28 ++ .../marvis-tts-250m-v0.2-MLX-4bit/config.json | 307 ++++++++++++++++++ .../generation_config.json | 12 + .../marvis-tts-250m-v0.2-MLX-4bit/merges.txt | 3 + .../model.safetensors | 3 + .../model.safetensors.index.json | 253 +++++++++++++++ .../prompts/conversational_a.txt | 1 + .../prompts/conversational_a.wav | 3 + .../prompts/conversational_b.txt | 1 + .../prompts/conversational_b.wav | 3 + .../prompts/conversational_de.txt | 1 + .../prompts/conversational_de.wav | 3 + .../prompts/conversational_fr.txt | 1 + .../prompts/conversational_fr.wav | 3 + .../special_tokens_map.json | 30 ++ .../tokenizer.json | 3 + .../tokenizer_config.json | 168 ++++++++++ .../marvis-tts-250m-v0.2-MLX-4bit/vocab.json | 3 + .../marvis-tts-250m-v0.2-MLX-8bit/README.md | 28 ++ .../marvis-tts-250m-v0.2-MLX-8bit/config.json | 307 ++++++++++++++++++ .../generation_config.json | 12 + .../marvis-tts-250m-v0.2-MLX-8bit/merges.txt | 3 + .../model.safetensors | 3 + .../model.safetensors.index.json | 253 +++++++++++++++ .../prompts/conversational_a.txt | 1 + .../prompts/conversational_a.wav | 3 + .../prompts/conversational_b.txt | 1 + .../prompts/conversational_b.wav | 3 + .../prompts/conversational_de.txt | 1 + .../prompts/conversational_de.wav | 3 + .../prompts/conversational_fr.txt | 1 + .../prompts/conversational_fr.wav | 3 + .../special_tokens_map.json | 30 ++ .../tokenizer.json | 3 + .../tokenizer_config.json | 168 ++++++++++ .../marvis-tts-250m-v0.2-MLX-8bit/vocab.json | 3 + 38 files changed, 1657 insertions(+) create mode 100644 voice/codec/kyutai/mimi/tokenizer-e351c8d8-checkpoint125.safetensors create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/README.md create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/config.json create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/generation_config.json create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/merges.txt create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/model.safetensors create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/model.safetensors.index.json create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_a.txt create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_a.wav create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_b.txt create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_b.wav create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_de.txt create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_de.wav create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_fr.txt create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_fr.wav create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/special_tokens_map.json create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/tokenizer.json create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/tokenizer_config.json create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/vocab.json create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/README.md create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/config.json create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/generation_config.json create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/merges.txt create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/model.safetensors create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/model.safetensors.index.json create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_a.txt create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_a.wav create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_b.txt create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_b.wav create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_de.txt create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_de.wav create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_fr.txt create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_fr.wav create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/special_tokens_map.json create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/tokenizer.json create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/tokenizer_config.json create mode 100755 voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/vocab.json diff --git a/.gitattributes b/.gitattributes index c6b77ca..d61f4a0 100644 --- a/.gitattributes +++ b/.gitattributes @@ -11,3 +11,5 @@ tokenizer.json filter=lfs diff=lfs merge=lfs -text vocab.json filter=lfs diff=lfs merge=lfs -text merges.txt filter=lfs diff=lfs merge=lfs -text *.litertlm filter=lfs diff=lfs merge=lfs -text +voice/**/*.safetensors filter=lfs diff=lfs merge=lfs -text +voice/**/*.wav filter=lfs diff=lfs merge=lfs -text diff --git a/voice/codec/kyutai/mimi/tokenizer-e351c8d8-checkpoint125.safetensors b/voice/codec/kyutai/mimi/tokenizer-e351c8d8-checkpoint125.safetensors new file mode 100644 index 0000000..c8d5e4c --- /dev/null +++ b/voice/codec/kyutai/mimi/tokenizer-e351c8d8-checkpoint125.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:09b782f0629851a271227fb9d36db65c041790365f11bbe5d3d59369cf863f50 +size 384644900 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/README.md b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/README.md new file mode 100755 index 0000000..614e224 --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/README.md @@ -0,0 +1,28 @@ +--- +license: apache-2.0 +datasets: +- amphion/Emilia-Dataset +language: +- en +- fr +- de +library_name: transformers +tags: +- mlx +- mlx-audio +- transformers +- mlx +--- + +# Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit +This model was converted to MLX format from [`Marvis-AI/marvis-tts-250m-v0.2`](https://huggingface.co/Marvis-AI/marvis-tts-250m-v0.2) using mlx-audio version **0.2.6**. +Refer to the [original model card](https://huggingface.co/Marvis-AI/marvis-tts-250m-v0.2) for more details on the model. +## Use with mlx + +```bash +pip install -U mlx-audio +``` + +```bash +python -m mlx_audio.tts.generate --model Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit --text "Describe this image." +``` diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/config.json b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/config.json new file mode 100755 index 0000000..1f3348b --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/config.json @@ -0,0 +1,307 @@ +{ + "add_cross_attention": false, + "architectures": [ + "CsmForConditionalGeneration" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "audio_eos_token_id": 128003, + "audio_num_codebooks": 32, + "audio_token_id": 128002, + "audio_vocab_size": 2051, + "backbone_flavor": "llama-250M", + "bad_words_ids": null, + "begin_suppress_tokens": null, + "bos_token_id": 128000, + "chunk_size_feed_forward": 0, + "codebook_eos_token_id": 0, + "codebook_pad_token_id": 2050, + "codec_config": { + "sampling_rate": 24000, + "audio_channels": 1, + "hidden_size": 512, + "num_filters": 64, + "num_residual_layers": 1, + "upsampling_ratios": [ + 8, + 6, + 5, + 4 + ], + "kernel_size": 7, + "last_kernel_size": 3, + "residual_kernel_size": 3, + "dilation_growth_rate": 2, + "use_causal_conv": true, + "pad_mode": "constant", + "compress": 2, + "trim_right_ratio": 1.0, + "codebook_size": 2048, + "codebook_dim": 256, + "num_quantizers": 32, + "use_conv_shortcut": false, + "vector_quantization_hidden_dimension": 256, + "upsample_groups": 512, + "num_hidden_layers": 8, + "intermediate_size": 2048, + "num_attention_heads": 8, + "num_key_value_heads": 8, + "hidden_act": "gelu", + "max_position_embeddings": 8000, + "initializer_range": 0.02, + "norm_eps": 1e-05, + "use_cache": false, + "use_streaming": false, + "rope_theta": 10000.0, + "sliding_window": 250, + "attention_dropout": 0.0, + "head_dim": 64, + "layer_scale_initial_scale": 0.01, + "attention_bias": false, + "_frame_rate": 12.5, + "num_semantic_quantizers": 1, + "return_dict": true, + "output_hidden_states": false, + "torchscript": false, + "dtype": "float32", + "pruned_heads": {}, + "tie_word_embeddings": true, + "chunk_size_feed_forward": 0, + "is_encoder_decoder": false, + "is_decoder": false, + "cross_attention_hidden_size": null, + "add_cross_attention": false, + "tie_encoder_decoder": false, + "architectures": [ + "MimiModel" + ], + "finetuning_task": null, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "task_specific_params": null, + "problem_type": null, + "tokenizer_class": null, + "prefix": null, + "bos_token_id": null, + "pad_token_id": null, + "eos_token_id": null, + "sep_token_id": null, + "decoder_start_token_id": null, + "max_length": 20, + "min_length": 0, + "do_sample": false, + "early_stopping": false, + "num_beams": 1, + "temperature": 1.0, + "top_k": 50, + "top_p": 1.0, + "typical_p": 1.0, + "repetition_penalty": 1.0, + "length_penalty": 1.0, + "no_repeat_ngram_size": 0, + "encoder_no_repeat_ngram_size": 0, + "bad_words_ids": null, + "num_return_sequences": 1, + "output_scores": false, + "return_dict_in_generate": false, + "forced_bos_token_id": null, + "forced_eos_token_id": null, + "remove_invalid_values": false, + "exponential_decay_length_penalty": null, + "suppress_tokens": null, + "begin_suppress_tokens": null, + "num_beam_groups": 1, + "diversity_penalty": 0.0, + "_name_or_path": "kyutai/mimi", + "normalize": false, + "tf_legacy_loss": false, + "use_bfloat16": false, + "model_type": "mimi", + "output_attentions": false + }, + "cross_attention_hidden_size": null, + "decoder_flavor": "llama-60M", + "decoder_start_token_id": null, + "depth_decoder_config": { + "return_dict": true, + "output_hidden_states": false, + "torchscript": false, + "dtype": null, + "pruned_heads": {}, + "tie_word_embeddings": false, + "chunk_size_feed_forward": 0, + "is_encoder_decoder": false, + "is_decoder": false, + "cross_attention_hidden_size": null, + "add_cross_attention": false, + "tie_encoder_decoder": false, + "architectures": null, + "finetuning_task": null, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "task_specific_params": null, + "problem_type": null, + "tokenizer_class": null, + "prefix": null, + "bos_token_id": null, + "pad_token_id": null, + "eos_token_id": null, + "sep_token_id": null, + "decoder_start_token_id": null, + "max_length": 20, + "min_length": 0, + "do_sample": false, + "early_stopping": false, + "num_beams": 1, + "temperature": 1.0, + "top_k": 50, + "top_p": 1.0, + "typical_p": 1.0, + "repetition_penalty": 1.0, + "length_penalty": 1.0, + "no_repeat_ngram_size": 0, + "encoder_no_repeat_ngram_size": 0, + "bad_words_ids": null, + "num_return_sequences": 1, + "output_scores": false, + "return_dict_in_generate": false, + "forced_bos_token_id": null, + "forced_eos_token_id": null, + "remove_invalid_values": false, + "exponential_decay_length_penalty": null, + "suppress_tokens": null, + "begin_suppress_tokens": null, + "num_beam_groups": 1, + "diversity_penalty": 0.0, + "_name_or_path": "", + "model_type": "csm_depth_decoder_model", + "tf_legacy_loss": false, + "use_bfloat16": false, + "num_codebooks": 32, + "vocab_size": 2051, + "backbone_hidden_size": 1536, + "max_position_embeddings": 33, + "hidden_size": 1024, + "intermediate_size": 4096, + "num_hidden_layers": 4, + "num_attention_heads": 8, + "num_key_value_heads": 2, + "hidden_act": "silu", + "initializer_range": 0.02, + "rms_norm_eps": 1e-05, + "use_cache": true, + "rope_theta": 500000, + "rope_scaling": { + "factor": 32.0, + "high_freq_factor": 0.0078125, + "low_freq_factor": 0.001953125, + "original_max_position_embeddings": 16, + "rope_type": "llama3" + }, + "attention_bias": false, + "attention_dropout": 0.0, + "mlp_bias": false, + "head_dim": 128, + "output_attentions": false + }, + "diversity_penalty": 0.0, + "do_sample": false, + "dtype": null, + "early_stopping": false, + "encoder_no_repeat_ngram_size": 0, + "eos_token_id": null, + "exponential_decay_length_penalty": null, + "finetuning_task": null, + "forced_bos_token_id": null, + "forced_eos_token_id": null, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 1536, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "intermediate_size": 8192, + "is_decoder": false, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "length_penalty": 1.0, + "max_length": 20, + "max_position_embeddings": 2048, + "min_length": 0, + "mlp_bias": false, + "model_type": "csm", + "no_repeat_ngram_size": 0, + "num_attention_heads": 12, + "num_beam_groups": 1, + "num_beams": 1, + "num_codebooks": 32, + "num_hidden_layers": 6, + "num_key_value_heads": 3, + "num_return_sequences": 1, + "output_attentions": false, + "output_hidden_states": false, + "output_scores": false, + "pad_token_id": 128002, + "prefix": null, + "problem_type": null, + "pruned_heads": {}, + "quantization": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "quantization_config": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "remove_invalid_values": false, + "repetition_penalty": 1.0, + "return_dict": true, + "return_dict_in_generate": false, + "rms_norm_eps": 1e-05, + "rope_scaling": { + "factor": 32.0, + "high_freq_factor": 0.5, + "low_freq_factor": 0.125, + "original_max_position_embeddings": 1024, + "rope_type": "llama3" + }, + "rope_theta": 500000, + "sep_token_id": null, + "suppress_tokens": null, + "task_specific_params": null, + "temperature": 1.0, + "text_tokenizer": "Marvis-AI/marvis-tts-250m-v0.2", + "text_vocab_size": 49152, + "tf_legacy_loss": false, + "tie_codebooks_embeddings": true, + "tie_encoder_decoder": false, + "tie_word_embeddings": false, + "tokenizer_class": null, + "top_k": 50, + "top_p": 1.0, + "torchscript": false, + "transformers_version": "4.57.1", + "typical_p": 1.0, + "use_bfloat16": false, + "use_cache": true, + "vocab_size": 2051 +} \ No newline at end of file diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/generation_config.json b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/generation_config.json new file mode 100755 index 0000000..49de1a7 --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/generation_config.json @@ -0,0 +1,12 @@ +{ + "bos_token_id": 1, + "depth_decoder__from_model_config": true, + "depth_decoder_do_sample": true, + "depth_decoder_temperature": 0.9, + "depth_decoder_top_k": 50, + "do_sample": true, + "max_new_tokens": 125, + "pad_token_id": 0, + "temperature": 0.9, + "transformers_version": "4.54.1" +} diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/merges.txt b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/merges.txt new file mode 100755 index 0000000..3e77b78 --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/merges.txt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0b54e8aa4e53d5383e2e4bc635a56b43f9647f7b13832d5d9ecd8f82dac4f510 +size 466391 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/model.safetensors b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/model.safetensors new file mode 100755 index 0000000..76c82f1 --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a178cd023b73856e9b5f513f9550ca99eff92bc89401f729a8ba4335f7c106a0 +size 413649690 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/model.safetensors.index.json b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/model.safetensors.index.json new file mode 100755 index 0000000..2636097 --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/model.safetensors.index.json @@ -0,0 +1,253 @@ +{ + "metadata": { + "total_size": 413620768, + "total_parameters": 599911265 + }, + "weight_map": { + "model.audio_embeddings.biases": "model.safetensors", + "model.audio_embeddings.scales": "model.safetensors", + "model.audio_embeddings.weight": "model.safetensors", + "model.audio_head": "model.safetensors", + "model.backbone.layers.0.input_layernorm.weight": "model.safetensors", + "model.backbone.layers.0.mlp.down_proj.biases": "model.safetensors", + "model.backbone.layers.0.mlp.down_proj.scales": "model.safetensors", + "model.backbone.layers.0.mlp.down_proj.weight": "model.safetensors", + "model.backbone.layers.0.mlp.gate_proj.biases": "model.safetensors", + "model.backbone.layers.0.mlp.gate_proj.scales": "model.safetensors", + "model.backbone.layers.0.mlp.gate_proj.weight": "model.safetensors", + "model.backbone.layers.0.mlp.up_proj.biases": "model.safetensors", + "model.backbone.layers.0.mlp.up_proj.scales": "model.safetensors", + "model.backbone.layers.0.mlp.up_proj.weight": "model.safetensors", + "model.backbone.layers.0.post_attention_layernorm.weight": "model.safetensors", + "model.backbone.layers.0.self_attn.k_proj.biases": "model.safetensors", + "model.backbone.layers.0.self_attn.k_proj.scales": "model.safetensors", + "model.backbone.layers.0.self_attn.k_proj.weight": "model.safetensors", + "model.backbone.layers.0.self_attn.o_proj.biases": "model.safetensors", + "model.backbone.layers.0.self_attn.o_proj.scales": "model.safetensors", + "model.backbone.layers.0.self_attn.o_proj.weight": "model.safetensors", + "model.backbone.layers.0.self_attn.q_proj.biases": "model.safetensors", + "model.backbone.layers.0.self_attn.q_proj.scales": "model.safetensors", + "model.backbone.layers.0.self_attn.q_proj.weight": "model.safetensors", + "model.backbone.layers.0.self_attn.v_proj.biases": "model.safetensors", + "model.backbone.layers.0.self_attn.v_proj.scales": "model.safetensors", + "model.backbone.layers.0.self_attn.v_proj.weight": "model.safetensors", + "model.backbone.layers.1.input_layernorm.weight": "model.safetensors", + "model.backbone.layers.1.mlp.down_proj.biases": "model.safetensors", + "model.backbone.layers.1.mlp.down_proj.scales": "model.safetensors", + "model.backbone.layers.1.mlp.down_proj.weight": "model.safetensors", + "model.backbone.layers.1.mlp.gate_proj.biases": "model.safetensors", + "model.backbone.layers.1.mlp.gate_proj.scales": "model.safetensors", + "model.backbone.layers.1.mlp.gate_proj.weight": "model.safetensors", + "model.backbone.layers.1.mlp.up_proj.biases": "model.safetensors", + "model.backbone.layers.1.mlp.up_proj.scales": "model.safetensors", + "model.backbone.layers.1.mlp.up_proj.weight": "model.safetensors", + "model.backbone.layers.1.post_attention_layernorm.weight": "model.safetensors", + "model.backbone.layers.1.self_attn.k_proj.biases": "model.safetensors", + "model.backbone.layers.1.self_attn.k_proj.scales": "model.safetensors", + "model.backbone.layers.1.self_attn.k_proj.weight": "model.safetensors", + "model.backbone.layers.1.self_attn.o_proj.biases": "model.safetensors", + "model.backbone.layers.1.self_attn.o_proj.scales": "model.safetensors", + "model.backbone.layers.1.self_attn.o_proj.weight": "model.safetensors", + "model.backbone.layers.1.self_attn.q_proj.biases": "model.safetensors", + "model.backbone.layers.1.self_attn.q_proj.scales": "model.safetensors", + "model.backbone.layers.1.self_attn.q_proj.weight": "model.safetensors", + "model.backbone.layers.1.self_attn.v_proj.biases": "model.safetensors", + "model.backbone.layers.1.self_attn.v_proj.scales": "model.safetensors", + "model.backbone.layers.1.self_attn.v_proj.weight": "model.safetensors", + "model.backbone.layers.2.input_layernorm.weight": "model.safetensors", + "model.backbone.layers.2.mlp.down_proj.biases": "model.safetensors", + "model.backbone.layers.2.mlp.down_proj.scales": "model.safetensors", + "model.backbone.layers.2.mlp.down_proj.weight": "model.safetensors", + "model.backbone.layers.2.mlp.gate_proj.biases": "model.safetensors", + "model.backbone.layers.2.mlp.gate_proj.scales": "model.safetensors", + "model.backbone.layers.2.mlp.gate_proj.weight": "model.safetensors", + "model.backbone.layers.2.mlp.up_proj.biases": "model.safetensors", + "model.backbone.layers.2.mlp.up_proj.scales": "model.safetensors", + "model.backbone.layers.2.mlp.up_proj.weight": "model.safetensors", + "model.backbone.layers.2.post_attention_layernorm.weight": "model.safetensors", + "model.backbone.layers.2.self_attn.k_proj.biases": "model.safetensors", + "model.backbone.layers.2.self_attn.k_proj.scales": "model.safetensors", + "model.backbone.layers.2.self_attn.k_proj.weight": "model.safetensors", + "model.backbone.layers.2.self_attn.o_proj.biases": "model.safetensors", + "model.backbone.layers.2.self_attn.o_proj.scales": "model.safetensors", + "model.backbone.layers.2.self_attn.o_proj.weight": "model.safetensors", + "model.backbone.layers.2.self_attn.q_proj.biases": "model.safetensors", + "model.backbone.layers.2.self_attn.q_proj.scales": "model.safetensors", + "model.backbone.layers.2.self_attn.q_proj.weight": "model.safetensors", + "model.backbone.layers.2.self_attn.v_proj.biases": "model.safetensors", + "model.backbone.layers.2.self_attn.v_proj.scales": "model.safetensors", + "model.backbone.layers.2.self_attn.v_proj.weight": "model.safetensors", + "model.backbone.layers.3.input_layernorm.weight": "model.safetensors", + "model.backbone.layers.3.mlp.down_proj.biases": "model.safetensors", + "model.backbone.layers.3.mlp.down_proj.scales": "model.safetensors", + "model.backbone.layers.3.mlp.down_proj.weight": "model.safetensors", + "model.backbone.layers.3.mlp.gate_proj.biases": "model.safetensors", + "model.backbone.layers.3.mlp.gate_proj.scales": "model.safetensors", + "model.backbone.layers.3.mlp.gate_proj.weight": "model.safetensors", + "model.backbone.layers.3.mlp.up_proj.biases": "model.safetensors", + "model.backbone.layers.3.mlp.up_proj.scales": "model.safetensors", + "model.backbone.layers.3.mlp.up_proj.weight": "model.safetensors", + "model.backbone.layers.3.post_attention_layernorm.weight": "model.safetensors", + "model.backbone.layers.3.self_attn.k_proj.biases": "model.safetensors", + "model.backbone.layers.3.self_attn.k_proj.scales": "model.safetensors", + "model.backbone.layers.3.self_attn.k_proj.weight": "model.safetensors", + "model.backbone.layers.3.self_attn.o_proj.biases": "model.safetensors", + "model.backbone.layers.3.self_attn.o_proj.scales": "model.safetensors", + "model.backbone.layers.3.self_attn.o_proj.weight": "model.safetensors", + "model.backbone.layers.3.self_attn.q_proj.biases": "model.safetensors", + "model.backbone.layers.3.self_attn.q_proj.scales": "model.safetensors", + "model.backbone.layers.3.self_attn.q_proj.weight": "model.safetensors", + "model.backbone.layers.3.self_attn.v_proj.biases": "model.safetensors", + "model.backbone.layers.3.self_attn.v_proj.scales": "model.safetensors", + "model.backbone.layers.3.self_attn.v_proj.weight": "model.safetensors", + "model.backbone.layers.4.input_layernorm.weight": "model.safetensors", + "model.backbone.layers.4.mlp.down_proj.biases": "model.safetensors", + "model.backbone.layers.4.mlp.down_proj.scales": "model.safetensors", + "model.backbone.layers.4.mlp.down_proj.weight": "model.safetensors", + "model.backbone.layers.4.mlp.gate_proj.biases": "model.safetensors", + "model.backbone.layers.4.mlp.gate_proj.scales": "model.safetensors", + "model.backbone.layers.4.mlp.gate_proj.weight": "model.safetensors", + "model.backbone.layers.4.mlp.up_proj.biases": "model.safetensors", + "model.backbone.layers.4.mlp.up_proj.scales": "model.safetensors", + "model.backbone.layers.4.mlp.up_proj.weight": "model.safetensors", + "model.backbone.layers.4.post_attention_layernorm.weight": "model.safetensors", + "model.backbone.layers.4.self_attn.k_proj.biases": "model.safetensors", + "model.backbone.layers.4.self_attn.k_proj.scales": "model.safetensors", + "model.backbone.layers.4.self_attn.k_proj.weight": "model.safetensors", + "model.backbone.layers.4.self_attn.o_proj.biases": "model.safetensors", + "model.backbone.layers.4.self_attn.o_proj.scales": "model.safetensors", + "model.backbone.layers.4.self_attn.o_proj.weight": "model.safetensors", + "model.backbone.layers.4.self_attn.q_proj.biases": "model.safetensors", + "model.backbone.layers.4.self_attn.q_proj.scales": "model.safetensors", + "model.backbone.layers.4.self_attn.q_proj.weight": "model.safetensors", + "model.backbone.layers.4.self_attn.v_proj.biases": "model.safetensors", + "model.backbone.layers.4.self_attn.v_proj.scales": "model.safetensors", + "model.backbone.layers.4.self_attn.v_proj.weight": "model.safetensors", + "model.backbone.layers.5.input_layernorm.weight": "model.safetensors", + "model.backbone.layers.5.mlp.down_proj.biases": "model.safetensors", + "model.backbone.layers.5.mlp.down_proj.scales": "model.safetensors", + "model.backbone.layers.5.mlp.down_proj.weight": "model.safetensors", + "model.backbone.layers.5.mlp.gate_proj.biases": "model.safetensors", + "model.backbone.layers.5.mlp.gate_proj.scales": "model.safetensors", + "model.backbone.layers.5.mlp.gate_proj.weight": "model.safetensors", + "model.backbone.layers.5.mlp.up_proj.biases": "model.safetensors", + "model.backbone.layers.5.mlp.up_proj.scales": "model.safetensors", + "model.backbone.layers.5.mlp.up_proj.weight": "model.safetensors", + "model.backbone.layers.5.post_attention_layernorm.weight": "model.safetensors", + "model.backbone.layers.5.self_attn.k_proj.biases": "model.safetensors", + "model.backbone.layers.5.self_attn.k_proj.scales": "model.safetensors", + "model.backbone.layers.5.self_attn.k_proj.weight": "model.safetensors", + "model.backbone.layers.5.self_attn.o_proj.biases": "model.safetensors", + "model.backbone.layers.5.self_attn.o_proj.scales": "model.safetensors", + "model.backbone.layers.5.self_attn.o_proj.weight": "model.safetensors", + "model.backbone.layers.5.self_attn.q_proj.biases": "model.safetensors", + "model.backbone.layers.5.self_attn.q_proj.scales": "model.safetensors", + "model.backbone.layers.5.self_attn.q_proj.weight": "model.safetensors", + "model.backbone.layers.5.self_attn.v_proj.biases": "model.safetensors", + "model.backbone.layers.5.self_attn.v_proj.scales": "model.safetensors", + "model.backbone.layers.5.self_attn.v_proj.weight": "model.safetensors", + "model.backbone.norm.weight": "model.safetensors", + "model.codebook0_head.biases": "model.safetensors", + "model.codebook0_head.scales": "model.safetensors", + "model.codebook0_head.weight": "model.safetensors", + "model.decoder.layers.0.input_layernorm.weight": "model.safetensors", + "model.decoder.layers.0.mlp.down_proj.biases": "model.safetensors", + "model.decoder.layers.0.mlp.down_proj.scales": "model.safetensors", + "model.decoder.layers.0.mlp.down_proj.weight": "model.safetensors", + "model.decoder.layers.0.mlp.gate_proj.biases": "model.safetensors", + "model.decoder.layers.0.mlp.gate_proj.scales": "model.safetensors", + "model.decoder.layers.0.mlp.gate_proj.weight": "model.safetensors", + "model.decoder.layers.0.mlp.up_proj.biases": "model.safetensors", + "model.decoder.layers.0.mlp.up_proj.scales": "model.safetensors", + "model.decoder.layers.0.mlp.up_proj.weight": "model.safetensors", + "model.decoder.layers.0.post_attention_layernorm.weight": "model.safetensors", + "model.decoder.layers.0.self_attn.k_proj.biases": "model.safetensors", + "model.decoder.layers.0.self_attn.k_proj.scales": "model.safetensors", + "model.decoder.layers.0.self_attn.k_proj.weight": "model.safetensors", + "model.decoder.layers.0.self_attn.o_proj.biases": "model.safetensors", + "model.decoder.layers.0.self_attn.o_proj.scales": "model.safetensors", + "model.decoder.layers.0.self_attn.o_proj.weight": "model.safetensors", + "model.decoder.layers.0.self_attn.q_proj.biases": "model.safetensors", + "model.decoder.layers.0.self_attn.q_proj.scales": "model.safetensors", + "model.decoder.layers.0.self_attn.q_proj.weight": "model.safetensors", + "model.decoder.layers.0.self_attn.v_proj.biases": "model.safetensors", + "model.decoder.layers.0.self_attn.v_proj.scales": "model.safetensors", + "model.decoder.layers.0.self_attn.v_proj.weight": "model.safetensors", + "model.decoder.layers.1.input_layernorm.weight": "model.safetensors", + "model.decoder.layers.1.mlp.down_proj.biases": "model.safetensors", + "model.decoder.layers.1.mlp.down_proj.scales": "model.safetensors", + "model.decoder.layers.1.mlp.down_proj.weight": "model.safetensors", + "model.decoder.layers.1.mlp.gate_proj.biases": "model.safetensors", + "model.decoder.layers.1.mlp.gate_proj.scales": "model.safetensors", + "model.decoder.layers.1.mlp.gate_proj.weight": "model.safetensors", + "model.decoder.layers.1.mlp.up_proj.biases": "model.safetensors", + "model.decoder.layers.1.mlp.up_proj.scales": "model.safetensors", + "model.decoder.layers.1.mlp.up_proj.weight": "model.safetensors", + "model.decoder.layers.1.post_attention_layernorm.weight": "model.safetensors", + "model.decoder.layers.1.self_attn.k_proj.biases": "model.safetensors", + "model.decoder.layers.1.self_attn.k_proj.scales": "model.safetensors", + "model.decoder.layers.1.self_attn.k_proj.weight": "model.safetensors", + "model.decoder.layers.1.self_attn.o_proj.biases": "model.safetensors", + "model.decoder.layers.1.self_attn.o_proj.scales": "model.safetensors", + "model.decoder.layers.1.self_attn.o_proj.weight": "model.safetensors", + "model.decoder.layers.1.self_attn.q_proj.biases": "model.safetensors", + "model.decoder.layers.1.self_attn.q_proj.scales": "model.safetensors", + "model.decoder.layers.1.self_attn.q_proj.weight": "model.safetensors", + "model.decoder.layers.1.self_attn.v_proj.biases": "model.safetensors", + "model.decoder.layers.1.self_attn.v_proj.scales": "model.safetensors", + "model.decoder.layers.1.self_attn.v_proj.weight": "model.safetensors", + "model.decoder.layers.2.input_layernorm.weight": "model.safetensors", + "model.decoder.layers.2.mlp.down_proj.biases": "model.safetensors", + "model.decoder.layers.2.mlp.down_proj.scales": "model.safetensors", + "model.decoder.layers.2.mlp.down_proj.weight": "model.safetensors", + "model.decoder.layers.2.mlp.gate_proj.biases": "model.safetensors", + "model.decoder.layers.2.mlp.gate_proj.scales": "model.safetensors", + "model.decoder.layers.2.mlp.gate_proj.weight": "model.safetensors", + "model.decoder.layers.2.mlp.up_proj.biases": "model.safetensors", + "model.decoder.layers.2.mlp.up_proj.scales": "model.safetensors", + "model.decoder.layers.2.mlp.up_proj.weight": "model.safetensors", + "model.decoder.layers.2.post_attention_layernorm.weight": "model.safetensors", + "model.decoder.layers.2.self_attn.k_proj.biases": "model.safetensors", + "model.decoder.layers.2.self_attn.k_proj.scales": "model.safetensors", + "model.decoder.layers.2.self_attn.k_proj.weight": "model.safetensors", + "model.decoder.layers.2.self_attn.o_proj.biases": "model.safetensors", + "model.decoder.layers.2.self_attn.o_proj.scales": "model.safetensors", + "model.decoder.layers.2.self_attn.o_proj.weight": "model.safetensors", + "model.decoder.layers.2.self_attn.q_proj.biases": "model.safetensors", + "model.decoder.layers.2.self_attn.q_proj.scales": "model.safetensors", + "model.decoder.layers.2.self_attn.q_proj.weight": "model.safetensors", + "model.decoder.layers.2.self_attn.v_proj.biases": "model.safetensors", + "model.decoder.layers.2.self_attn.v_proj.scales": "model.safetensors", + "model.decoder.layers.2.self_attn.v_proj.weight": "model.safetensors", + "model.decoder.layers.3.input_layernorm.weight": "model.safetensors", + "model.decoder.layers.3.mlp.down_proj.biases": "model.safetensors", + "model.decoder.layers.3.mlp.down_proj.scales": "model.safetensors", + "model.decoder.layers.3.mlp.down_proj.weight": "model.safetensors", + "model.decoder.layers.3.mlp.gate_proj.biases": "model.safetensors", + "model.decoder.layers.3.mlp.gate_proj.scales": "model.safetensors", + "model.decoder.layers.3.mlp.gate_proj.weight": "model.safetensors", + "model.decoder.layers.3.mlp.up_proj.biases": "model.safetensors", + "model.decoder.layers.3.mlp.up_proj.scales": "model.safetensors", + "model.decoder.layers.3.mlp.up_proj.weight": "model.safetensors", + "model.decoder.layers.3.post_attention_layernorm.weight": "model.safetensors", + "model.decoder.layers.3.self_attn.k_proj.biases": "model.safetensors", + "model.decoder.layers.3.self_attn.k_proj.scales": "model.safetensors", + "model.decoder.layers.3.self_attn.k_proj.weight": "model.safetensors", + "model.decoder.layers.3.self_attn.o_proj.biases": "model.safetensors", + "model.decoder.layers.3.self_attn.o_proj.scales": "model.safetensors", + "model.decoder.layers.3.self_attn.o_proj.weight": "model.safetensors", + "model.decoder.layers.3.self_attn.q_proj.biases": "model.safetensors", + "model.decoder.layers.3.self_attn.q_proj.scales": "model.safetensors", + "model.decoder.layers.3.self_attn.q_proj.weight": "model.safetensors", + "model.decoder.layers.3.self_attn.v_proj.biases": "model.safetensors", + "model.decoder.layers.3.self_attn.v_proj.scales": "model.safetensors", + "model.decoder.layers.3.self_attn.v_proj.weight": "model.safetensors", + "model.decoder.norm.weight": "model.safetensors", + "model.projection.biases": "model.safetensors", + "model.projection.scales": "model.safetensors", + "model.projection.weight": "model.safetensors", + "model.text_embeddings.biases": "model.safetensors", + "model.text_embeddings.scales": "model.safetensors", + "model.text_embeddings.weight": "model.safetensors" + } +} \ No newline at end of file diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_a.txt b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_a.txt new file mode 100755 index 0000000..7ef228b --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_a.txt @@ -0,0 +1 @@ +Coffee's story likely begins in Ethiopia, where legend tells of a goat herder named Kaldi who noticed his goats became energetic after eating red berries from a particular bush. Curious, he tried them himself, and felt invigorated. \ No newline at end of file diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_a.wav b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_a.wav new file mode 100755 index 0000000..c3eb7ce --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_a.wav @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5901d2ee3a8282fefac96d28bea2f843da5b1c9673b6d3264ccdc3c6dbec5d2e +size 636564 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_b.txt b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_b.txt new file mode 100755 index 0000000..7ef228b --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_b.txt @@ -0,0 +1 @@ +Coffee's story likely begins in Ethiopia, where legend tells of a goat herder named Kaldi who noticed his goats became energetic after eating red berries from a particular bush. Curious, he tried them himself, and felt invigorated. \ No newline at end of file diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_b.wav b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_b.wav new file mode 100755 index 0000000..799fb2b --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_b.wav @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:478de94e01ee64b69b4865d6b64540c5840bb2aca9513ececca379a8cd633532 +size 635540 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_de.txt b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_de.txt new file mode 100755 index 0000000..1fbe01d --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_de.txt @@ -0,0 +1 @@ +Ich werde bald mehrere Sprachen sprechen, darunter auch Deutsch. \ No newline at end of file diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_de.wav b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_de.wav new file mode 100755 index 0000000..6fd0f6d --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_de.wav @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ea5f7cce5506dc9707dc5048a056fe67cf0da0cae528e4e69c4662c74e75f9a3 +size 200768 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_fr.txt b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_fr.txt new file mode 100755 index 0000000..ff3683e --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_fr.txt @@ -0,0 +1 @@ +J'ai toujours cru qu’un étrange voleur joyeux mangeait rapidement cinq gâteaux exquis près du vieux phare. \ No newline at end of file diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_fr.wav b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_fr.wav new file mode 100755 index 0000000..37121bd --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/prompts/conversational_fr.wav @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:985f00a09b6e66866b162c8155c7f5505a99972d5dfa2e35f86710842719120b +size 333680 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/special_tokens_map.json b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/special_tokens_map.json new file mode 100755 index 0000000..7033bdb --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/special_tokens_map.json @@ -0,0 +1,30 @@ +{ + "additional_special_tokens": [ + "<|endoftext|>", + "<|im_start|>", + "<|im_end|>", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "" + ], + "bos_token": "<|im_start|>", + "eos_token": "<|im_end|>", + "unk_token": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/tokenizer.json b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/tokenizer.json new file mode 100755 index 0000000..d187bca --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:05e0c4dbf3b0d768c82058441fb78d84340fd056fb4949cd216229ca18334bd0 +size 3523993 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/tokenizer_config.json b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/tokenizer_config.json new file mode 100755 index 0000000..d12fa8f --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/tokenizer_config.json @@ -0,0 +1,168 @@ +{ + "add_prefix_space": false, + "added_tokens_decoder": { + "0": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "1": { + "content": "<|im_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "2": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "3": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "4": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "5": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "6": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "7": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "8": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "9": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "10": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "11": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "12": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "13": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "14": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "15": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "16": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + } + }, + "additional_special_tokens": [ + "<|endoftext|>", + "<|im_start|>", + "<|im_end|>", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "" + ], + "bos_token": "<|im_start|>", + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "extra_special_tokens": {}, + "model_max_length": 8192, + "tokenizer_class": "GPT2Tokenizer", + "unk_token": "<|endoftext|>", + "vocab_size": 49152 +} diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/vocab.json b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/vocab.json new file mode 100755 index 0000000..0f7f821 --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-4bit/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:82b84012e3add4d01d12ba14442026e49b8cbbaead1f79ecf3d919784f82dc79 +size 800662 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/README.md b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/README.md new file mode 100755 index 0000000..2a662e9 --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/README.md @@ -0,0 +1,28 @@ +--- +license: apache-2.0 +datasets: +- amphion/Emilia-Dataset +language: +- en +- fr +- de +library_name: transformers +tags: +- mlx +- mlx-audio +- transformers +- mlx +--- + +# Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit +This model was converted to MLX format from [`Marvis-AI/marvis-tts-250m-v0.2`](https://huggingface.co/Marvis-AI/marvis-tts-250m-v0.2) using mlx-audio version **0.2.6**. +Refer to the [original model card](https://huggingface.co/Marvis-AI/marvis-tts-250m-v0.2) for more details on the model. +## Use with mlx + +```bash +pip install -U mlx-audio +``` + +```bash +python -m mlx_audio.tts.generate --model Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit --text "Describe this image." +``` diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/config.json b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/config.json new file mode 100755 index 0000000..ce2ec0f --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/config.json @@ -0,0 +1,307 @@ +{ + "add_cross_attention": false, + "architectures": [ + "CsmForConditionalGeneration" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "audio_eos_token_id": 128003, + "audio_num_codebooks": 32, + "audio_token_id": 128002, + "audio_vocab_size": 2051, + "backbone_flavor": "llama-250M", + "bad_words_ids": null, + "begin_suppress_tokens": null, + "bos_token_id": 128000, + "chunk_size_feed_forward": 0, + "codebook_eos_token_id": 0, + "codebook_pad_token_id": 2050, + "codec_config": { + "sampling_rate": 24000, + "audio_channels": 1, + "hidden_size": 512, + "num_filters": 64, + "num_residual_layers": 1, + "upsampling_ratios": [ + 8, + 6, + 5, + 4 + ], + "kernel_size": 7, + "last_kernel_size": 3, + "residual_kernel_size": 3, + "dilation_growth_rate": 2, + "use_causal_conv": true, + "pad_mode": "constant", + "compress": 2, + "trim_right_ratio": 1.0, + "codebook_size": 2048, + "codebook_dim": 256, + "num_quantizers": 32, + "use_conv_shortcut": false, + "vector_quantization_hidden_dimension": 256, + "upsample_groups": 512, + "num_hidden_layers": 8, + "intermediate_size": 2048, + "num_attention_heads": 8, + "num_key_value_heads": 8, + "hidden_act": "gelu", + "max_position_embeddings": 8000, + "initializer_range": 0.02, + "norm_eps": 1e-05, + "use_cache": false, + "use_streaming": false, + "rope_theta": 10000.0, + "sliding_window": 250, + "attention_dropout": 0.0, + "head_dim": 64, + "layer_scale_initial_scale": 0.01, + "attention_bias": false, + "_frame_rate": 12.5, + "num_semantic_quantizers": 1, + "return_dict": true, + "output_hidden_states": false, + "torchscript": false, + "dtype": "float32", + "pruned_heads": {}, + "tie_word_embeddings": true, + "chunk_size_feed_forward": 0, + "is_encoder_decoder": false, + "is_decoder": false, + "cross_attention_hidden_size": null, + "add_cross_attention": false, + "tie_encoder_decoder": false, + "architectures": [ + "MimiModel" + ], + "finetuning_task": null, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "task_specific_params": null, + "problem_type": null, + "tokenizer_class": null, + "prefix": null, + "bos_token_id": null, + "pad_token_id": null, + "eos_token_id": null, + "sep_token_id": null, + "decoder_start_token_id": null, + "max_length": 20, + "min_length": 0, + "do_sample": false, + "early_stopping": false, + "num_beams": 1, + "temperature": 1.0, + "top_k": 50, + "top_p": 1.0, + "typical_p": 1.0, + "repetition_penalty": 1.0, + "length_penalty": 1.0, + "no_repeat_ngram_size": 0, + "encoder_no_repeat_ngram_size": 0, + "bad_words_ids": null, + "num_return_sequences": 1, + "output_scores": false, + "return_dict_in_generate": false, + "forced_bos_token_id": null, + "forced_eos_token_id": null, + "remove_invalid_values": false, + "exponential_decay_length_penalty": null, + "suppress_tokens": null, + "begin_suppress_tokens": null, + "num_beam_groups": 1, + "diversity_penalty": 0.0, + "_name_or_path": "kyutai/mimi", + "normalize": false, + "tf_legacy_loss": false, + "use_bfloat16": false, + "model_type": "mimi", + "output_attentions": false + }, + "cross_attention_hidden_size": null, + "decoder_flavor": "llama-60M", + "decoder_start_token_id": null, + "depth_decoder_config": { + "return_dict": true, + "output_hidden_states": false, + "torchscript": false, + "dtype": null, + "pruned_heads": {}, + "tie_word_embeddings": false, + "chunk_size_feed_forward": 0, + "is_encoder_decoder": false, + "is_decoder": false, + "cross_attention_hidden_size": null, + "add_cross_attention": false, + "tie_encoder_decoder": false, + "architectures": null, + "finetuning_task": null, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "task_specific_params": null, + "problem_type": null, + "tokenizer_class": null, + "prefix": null, + "bos_token_id": null, + "pad_token_id": null, + "eos_token_id": null, + "sep_token_id": null, + "decoder_start_token_id": null, + "max_length": 20, + "min_length": 0, + "do_sample": false, + "early_stopping": false, + "num_beams": 1, + "temperature": 1.0, + "top_k": 50, + "top_p": 1.0, + "typical_p": 1.0, + "repetition_penalty": 1.0, + "length_penalty": 1.0, + "no_repeat_ngram_size": 0, + "encoder_no_repeat_ngram_size": 0, + "bad_words_ids": null, + "num_return_sequences": 1, + "output_scores": false, + "return_dict_in_generate": false, + "forced_bos_token_id": null, + "forced_eos_token_id": null, + "remove_invalid_values": false, + "exponential_decay_length_penalty": null, + "suppress_tokens": null, + "begin_suppress_tokens": null, + "num_beam_groups": 1, + "diversity_penalty": 0.0, + "_name_or_path": "", + "model_type": "csm_depth_decoder_model", + "tf_legacy_loss": false, + "use_bfloat16": false, + "num_codebooks": 32, + "vocab_size": 2051, + "backbone_hidden_size": 1536, + "max_position_embeddings": 33, + "hidden_size": 1024, + "intermediate_size": 4096, + "num_hidden_layers": 4, + "num_attention_heads": 8, + "num_key_value_heads": 2, + "hidden_act": "silu", + "initializer_range": 0.02, + "rms_norm_eps": 1e-05, + "use_cache": true, + "rope_theta": 500000, + "rope_scaling": { + "factor": 32.0, + "high_freq_factor": 0.0078125, + "low_freq_factor": 0.001953125, + "original_max_position_embeddings": 16, + "rope_type": "llama3" + }, + "attention_bias": false, + "attention_dropout": 0.0, + "mlp_bias": false, + "head_dim": 128, + "output_attentions": false + }, + "diversity_penalty": 0.0, + "do_sample": false, + "dtype": null, + "early_stopping": false, + "encoder_no_repeat_ngram_size": 0, + "eos_token_id": null, + "exponential_decay_length_penalty": null, + "finetuning_task": null, + "forced_bos_token_id": null, + "forced_eos_token_id": null, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 1536, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "intermediate_size": 8192, + "is_decoder": false, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "length_penalty": 1.0, + "max_length": 20, + "max_position_embeddings": 2048, + "min_length": 0, + "mlp_bias": false, + "model_type": "csm", + "no_repeat_ngram_size": 0, + "num_attention_heads": 12, + "num_beam_groups": 1, + "num_beams": 1, + "num_codebooks": 32, + "num_hidden_layers": 6, + "num_key_value_heads": 3, + "num_return_sequences": 1, + "output_attentions": false, + "output_hidden_states": false, + "output_scores": false, + "pad_token_id": 128002, + "prefix": null, + "problem_type": null, + "pruned_heads": {}, + "quantization": { + "group_size": 64, + "bits": 8, + "mode": "affine" + }, + "quantization_config": { + "group_size": 64, + "bits": 8, + "mode": "affine" + }, + "remove_invalid_values": false, + "repetition_penalty": 1.0, + "return_dict": true, + "return_dict_in_generate": false, + "rms_norm_eps": 1e-05, + "rope_scaling": { + "factor": 32.0, + "high_freq_factor": 0.5, + "low_freq_factor": 0.125, + "original_max_position_embeddings": 1024, + "rope_type": "llama3" + }, + "rope_theta": 500000, + "sep_token_id": null, + "suppress_tokens": null, + "task_specific_params": null, + "temperature": 1.0, + "text_tokenizer": "Marvis-AI/marvis-tts-250m-v0.2", + "text_vocab_size": 49152, + "tf_legacy_loss": false, + "tie_codebooks_embeddings": true, + "tie_encoder_decoder": false, + "tie_word_embeddings": false, + "tokenizer_class": null, + "top_k": 50, + "top_p": 1.0, + "torchscript": false, + "transformers_version": "4.57.1", + "typical_p": 1.0, + "use_bfloat16": false, + "use_cache": true, + "vocab_size": 2051 +} \ No newline at end of file diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/generation_config.json b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/generation_config.json new file mode 100755 index 0000000..49de1a7 --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/generation_config.json @@ -0,0 +1,12 @@ +{ + "bos_token_id": 1, + "depth_decoder__from_model_config": true, + "depth_decoder_do_sample": true, + "depth_decoder_temperature": 0.9, + "depth_decoder_top_k": 50, + "do_sample": true, + "max_new_tokens": 125, + "pad_token_id": 0, + "temperature": 0.9, + "transformers_version": "4.54.1" +} diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/merges.txt b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/merges.txt new file mode 100755 index 0000000..3e77b78 --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/merges.txt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0b54e8aa4e53d5383e2e4bc635a56b43f9647f7b13832d5d9ecd8f82dac4f510 +size 466391 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/model.safetensors b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/model.safetensors new file mode 100755 index 0000000..6f4f075 --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2225809b10196ed07fb3f2a577701ce174c014f6d8fe16e999417051f3ec140d +size 665515046 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/model.safetensors.index.json b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/model.safetensors.index.json new file mode 100755 index 0000000..2856e7a --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/model.safetensors.index.json @@ -0,0 +1,253 @@ +{ + "metadata": { + "total_size": 665486112, + "total_parameters": 599911265 + }, + "weight_map": { + "model.audio_embeddings.biases": "model.safetensors", + "model.audio_embeddings.scales": "model.safetensors", + "model.audio_embeddings.weight": "model.safetensors", + "model.audio_head": "model.safetensors", + "model.backbone.layers.0.input_layernorm.weight": "model.safetensors", + "model.backbone.layers.0.mlp.down_proj.biases": "model.safetensors", + "model.backbone.layers.0.mlp.down_proj.scales": "model.safetensors", + "model.backbone.layers.0.mlp.down_proj.weight": "model.safetensors", + "model.backbone.layers.0.mlp.gate_proj.biases": "model.safetensors", + "model.backbone.layers.0.mlp.gate_proj.scales": "model.safetensors", + "model.backbone.layers.0.mlp.gate_proj.weight": "model.safetensors", + "model.backbone.layers.0.mlp.up_proj.biases": "model.safetensors", + "model.backbone.layers.0.mlp.up_proj.scales": "model.safetensors", + "model.backbone.layers.0.mlp.up_proj.weight": "model.safetensors", + "model.backbone.layers.0.post_attention_layernorm.weight": "model.safetensors", + "model.backbone.layers.0.self_attn.k_proj.biases": "model.safetensors", + "model.backbone.layers.0.self_attn.k_proj.scales": "model.safetensors", + "model.backbone.layers.0.self_attn.k_proj.weight": "model.safetensors", + "model.backbone.layers.0.self_attn.o_proj.biases": "model.safetensors", + "model.backbone.layers.0.self_attn.o_proj.scales": "model.safetensors", + "model.backbone.layers.0.self_attn.o_proj.weight": "model.safetensors", + "model.backbone.layers.0.self_attn.q_proj.biases": "model.safetensors", + "model.backbone.layers.0.self_attn.q_proj.scales": "model.safetensors", + "model.backbone.layers.0.self_attn.q_proj.weight": "model.safetensors", + "model.backbone.layers.0.self_attn.v_proj.biases": "model.safetensors", + "model.backbone.layers.0.self_attn.v_proj.scales": "model.safetensors", + "model.backbone.layers.0.self_attn.v_proj.weight": "model.safetensors", + "model.backbone.layers.1.input_layernorm.weight": "model.safetensors", + "model.backbone.layers.1.mlp.down_proj.biases": "model.safetensors", + "model.backbone.layers.1.mlp.down_proj.scales": "model.safetensors", + "model.backbone.layers.1.mlp.down_proj.weight": "model.safetensors", + "model.backbone.layers.1.mlp.gate_proj.biases": "model.safetensors", + "model.backbone.layers.1.mlp.gate_proj.scales": "model.safetensors", + "model.backbone.layers.1.mlp.gate_proj.weight": "model.safetensors", + "model.backbone.layers.1.mlp.up_proj.biases": "model.safetensors", + "model.backbone.layers.1.mlp.up_proj.scales": "model.safetensors", + "model.backbone.layers.1.mlp.up_proj.weight": "model.safetensors", + "model.backbone.layers.1.post_attention_layernorm.weight": "model.safetensors", + "model.backbone.layers.1.self_attn.k_proj.biases": "model.safetensors", + "model.backbone.layers.1.self_attn.k_proj.scales": "model.safetensors", + "model.backbone.layers.1.self_attn.k_proj.weight": "model.safetensors", + "model.backbone.layers.1.self_attn.o_proj.biases": "model.safetensors", + "model.backbone.layers.1.self_attn.o_proj.scales": "model.safetensors", + "model.backbone.layers.1.self_attn.o_proj.weight": "model.safetensors", + "model.backbone.layers.1.self_attn.q_proj.biases": "model.safetensors", + "model.backbone.layers.1.self_attn.q_proj.scales": "model.safetensors", + "model.backbone.layers.1.self_attn.q_proj.weight": "model.safetensors", + "model.backbone.layers.1.self_attn.v_proj.biases": "model.safetensors", + "model.backbone.layers.1.self_attn.v_proj.scales": "model.safetensors", + "model.backbone.layers.1.self_attn.v_proj.weight": "model.safetensors", + "model.backbone.layers.2.input_layernorm.weight": "model.safetensors", + "model.backbone.layers.2.mlp.down_proj.biases": "model.safetensors", + "model.backbone.layers.2.mlp.down_proj.scales": "model.safetensors", + "model.backbone.layers.2.mlp.down_proj.weight": "model.safetensors", + "model.backbone.layers.2.mlp.gate_proj.biases": "model.safetensors", + "model.backbone.layers.2.mlp.gate_proj.scales": "model.safetensors", + "model.backbone.layers.2.mlp.gate_proj.weight": "model.safetensors", + "model.backbone.layers.2.mlp.up_proj.biases": "model.safetensors", + "model.backbone.layers.2.mlp.up_proj.scales": "model.safetensors", + "model.backbone.layers.2.mlp.up_proj.weight": "model.safetensors", + "model.backbone.layers.2.post_attention_layernorm.weight": "model.safetensors", + "model.backbone.layers.2.self_attn.k_proj.biases": "model.safetensors", + "model.backbone.layers.2.self_attn.k_proj.scales": "model.safetensors", + "model.backbone.layers.2.self_attn.k_proj.weight": "model.safetensors", + "model.backbone.layers.2.self_attn.o_proj.biases": "model.safetensors", + "model.backbone.layers.2.self_attn.o_proj.scales": "model.safetensors", + "model.backbone.layers.2.self_attn.o_proj.weight": "model.safetensors", + "model.backbone.layers.2.self_attn.q_proj.biases": "model.safetensors", + "model.backbone.layers.2.self_attn.q_proj.scales": "model.safetensors", + "model.backbone.layers.2.self_attn.q_proj.weight": "model.safetensors", + "model.backbone.layers.2.self_attn.v_proj.biases": "model.safetensors", + "model.backbone.layers.2.self_attn.v_proj.scales": "model.safetensors", + "model.backbone.layers.2.self_attn.v_proj.weight": "model.safetensors", + "model.backbone.layers.3.input_layernorm.weight": "model.safetensors", + "model.backbone.layers.3.mlp.down_proj.biases": "model.safetensors", + "model.backbone.layers.3.mlp.down_proj.scales": "model.safetensors", + "model.backbone.layers.3.mlp.down_proj.weight": "model.safetensors", + "model.backbone.layers.3.mlp.gate_proj.biases": "model.safetensors", + "model.backbone.layers.3.mlp.gate_proj.scales": "model.safetensors", + "model.backbone.layers.3.mlp.gate_proj.weight": "model.safetensors", + "model.backbone.layers.3.mlp.up_proj.biases": "model.safetensors", + "model.backbone.layers.3.mlp.up_proj.scales": "model.safetensors", + "model.backbone.layers.3.mlp.up_proj.weight": "model.safetensors", + "model.backbone.layers.3.post_attention_layernorm.weight": "model.safetensors", + "model.backbone.layers.3.self_attn.k_proj.biases": "model.safetensors", + "model.backbone.layers.3.self_attn.k_proj.scales": "model.safetensors", + "model.backbone.layers.3.self_attn.k_proj.weight": "model.safetensors", + "model.backbone.layers.3.self_attn.o_proj.biases": "model.safetensors", + "model.backbone.layers.3.self_attn.o_proj.scales": "model.safetensors", + "model.backbone.layers.3.self_attn.o_proj.weight": "model.safetensors", + "model.backbone.layers.3.self_attn.q_proj.biases": "model.safetensors", + "model.backbone.layers.3.self_attn.q_proj.scales": "model.safetensors", + "model.backbone.layers.3.self_attn.q_proj.weight": "model.safetensors", + "model.backbone.layers.3.self_attn.v_proj.biases": "model.safetensors", + "model.backbone.layers.3.self_attn.v_proj.scales": "model.safetensors", + "model.backbone.layers.3.self_attn.v_proj.weight": "model.safetensors", + "model.backbone.layers.4.input_layernorm.weight": "model.safetensors", + "model.backbone.layers.4.mlp.down_proj.biases": "model.safetensors", + "model.backbone.layers.4.mlp.down_proj.scales": "model.safetensors", + "model.backbone.layers.4.mlp.down_proj.weight": "model.safetensors", + "model.backbone.layers.4.mlp.gate_proj.biases": "model.safetensors", + "model.backbone.layers.4.mlp.gate_proj.scales": "model.safetensors", + "model.backbone.layers.4.mlp.gate_proj.weight": "model.safetensors", + "model.backbone.layers.4.mlp.up_proj.biases": "model.safetensors", + "model.backbone.layers.4.mlp.up_proj.scales": "model.safetensors", + "model.backbone.layers.4.mlp.up_proj.weight": "model.safetensors", + "model.backbone.layers.4.post_attention_layernorm.weight": "model.safetensors", + "model.backbone.layers.4.self_attn.k_proj.biases": "model.safetensors", + "model.backbone.layers.4.self_attn.k_proj.scales": "model.safetensors", + "model.backbone.layers.4.self_attn.k_proj.weight": "model.safetensors", + "model.backbone.layers.4.self_attn.o_proj.biases": "model.safetensors", + "model.backbone.layers.4.self_attn.o_proj.scales": "model.safetensors", + "model.backbone.layers.4.self_attn.o_proj.weight": "model.safetensors", + "model.backbone.layers.4.self_attn.q_proj.biases": "model.safetensors", + "model.backbone.layers.4.self_attn.q_proj.scales": "model.safetensors", + "model.backbone.layers.4.self_attn.q_proj.weight": "model.safetensors", + "model.backbone.layers.4.self_attn.v_proj.biases": "model.safetensors", + "model.backbone.layers.4.self_attn.v_proj.scales": "model.safetensors", + "model.backbone.layers.4.self_attn.v_proj.weight": "model.safetensors", + "model.backbone.layers.5.input_layernorm.weight": "model.safetensors", + "model.backbone.layers.5.mlp.down_proj.biases": "model.safetensors", + "model.backbone.layers.5.mlp.down_proj.scales": "model.safetensors", + "model.backbone.layers.5.mlp.down_proj.weight": "model.safetensors", + "model.backbone.layers.5.mlp.gate_proj.biases": "model.safetensors", + "model.backbone.layers.5.mlp.gate_proj.scales": "model.safetensors", + "model.backbone.layers.5.mlp.gate_proj.weight": "model.safetensors", + "model.backbone.layers.5.mlp.up_proj.biases": "model.safetensors", + "model.backbone.layers.5.mlp.up_proj.scales": "model.safetensors", + "model.backbone.layers.5.mlp.up_proj.weight": "model.safetensors", + "model.backbone.layers.5.post_attention_layernorm.weight": "model.safetensors", + "model.backbone.layers.5.self_attn.k_proj.biases": "model.safetensors", + "model.backbone.layers.5.self_attn.k_proj.scales": "model.safetensors", + "model.backbone.layers.5.self_attn.k_proj.weight": "model.safetensors", + "model.backbone.layers.5.self_attn.o_proj.biases": "model.safetensors", + "model.backbone.layers.5.self_attn.o_proj.scales": "model.safetensors", + "model.backbone.layers.5.self_attn.o_proj.weight": "model.safetensors", + "model.backbone.layers.5.self_attn.q_proj.biases": "model.safetensors", + "model.backbone.layers.5.self_attn.q_proj.scales": "model.safetensors", + "model.backbone.layers.5.self_attn.q_proj.weight": "model.safetensors", + "model.backbone.layers.5.self_attn.v_proj.biases": "model.safetensors", + "model.backbone.layers.5.self_attn.v_proj.scales": "model.safetensors", + "model.backbone.layers.5.self_attn.v_proj.weight": "model.safetensors", + "model.backbone.norm.weight": "model.safetensors", + "model.codebook0_head.biases": "model.safetensors", + "model.codebook0_head.scales": "model.safetensors", + "model.codebook0_head.weight": "model.safetensors", + "model.decoder.layers.0.input_layernorm.weight": "model.safetensors", + "model.decoder.layers.0.mlp.down_proj.biases": "model.safetensors", + "model.decoder.layers.0.mlp.down_proj.scales": "model.safetensors", + "model.decoder.layers.0.mlp.down_proj.weight": "model.safetensors", + "model.decoder.layers.0.mlp.gate_proj.biases": "model.safetensors", + "model.decoder.layers.0.mlp.gate_proj.scales": "model.safetensors", + "model.decoder.layers.0.mlp.gate_proj.weight": "model.safetensors", + "model.decoder.layers.0.mlp.up_proj.biases": "model.safetensors", + "model.decoder.layers.0.mlp.up_proj.scales": "model.safetensors", + "model.decoder.layers.0.mlp.up_proj.weight": "model.safetensors", + "model.decoder.layers.0.post_attention_layernorm.weight": "model.safetensors", + "model.decoder.layers.0.self_attn.k_proj.biases": "model.safetensors", + "model.decoder.layers.0.self_attn.k_proj.scales": "model.safetensors", + "model.decoder.layers.0.self_attn.k_proj.weight": "model.safetensors", + "model.decoder.layers.0.self_attn.o_proj.biases": "model.safetensors", + "model.decoder.layers.0.self_attn.o_proj.scales": "model.safetensors", + "model.decoder.layers.0.self_attn.o_proj.weight": "model.safetensors", + "model.decoder.layers.0.self_attn.q_proj.biases": "model.safetensors", + "model.decoder.layers.0.self_attn.q_proj.scales": "model.safetensors", + "model.decoder.layers.0.self_attn.q_proj.weight": "model.safetensors", + "model.decoder.layers.0.self_attn.v_proj.biases": "model.safetensors", + "model.decoder.layers.0.self_attn.v_proj.scales": "model.safetensors", + "model.decoder.layers.0.self_attn.v_proj.weight": "model.safetensors", + "model.decoder.layers.1.input_layernorm.weight": "model.safetensors", + "model.decoder.layers.1.mlp.down_proj.biases": "model.safetensors", + "model.decoder.layers.1.mlp.down_proj.scales": "model.safetensors", + "model.decoder.layers.1.mlp.down_proj.weight": "model.safetensors", + "model.decoder.layers.1.mlp.gate_proj.biases": "model.safetensors", + "model.decoder.layers.1.mlp.gate_proj.scales": "model.safetensors", + "model.decoder.layers.1.mlp.gate_proj.weight": "model.safetensors", + "model.decoder.layers.1.mlp.up_proj.biases": "model.safetensors", + "model.decoder.layers.1.mlp.up_proj.scales": "model.safetensors", + "model.decoder.layers.1.mlp.up_proj.weight": "model.safetensors", + "model.decoder.layers.1.post_attention_layernorm.weight": "model.safetensors", + "model.decoder.layers.1.self_attn.k_proj.biases": "model.safetensors", + "model.decoder.layers.1.self_attn.k_proj.scales": "model.safetensors", + "model.decoder.layers.1.self_attn.k_proj.weight": "model.safetensors", + "model.decoder.layers.1.self_attn.o_proj.biases": "model.safetensors", + "model.decoder.layers.1.self_attn.o_proj.scales": "model.safetensors", + "model.decoder.layers.1.self_attn.o_proj.weight": "model.safetensors", + "model.decoder.layers.1.self_attn.q_proj.biases": "model.safetensors", + "model.decoder.layers.1.self_attn.q_proj.scales": "model.safetensors", + "model.decoder.layers.1.self_attn.q_proj.weight": "model.safetensors", + "model.decoder.layers.1.self_attn.v_proj.biases": "model.safetensors", + "model.decoder.layers.1.self_attn.v_proj.scales": "model.safetensors", + "model.decoder.layers.1.self_attn.v_proj.weight": "model.safetensors", + "model.decoder.layers.2.input_layernorm.weight": "model.safetensors", + "model.decoder.layers.2.mlp.down_proj.biases": "model.safetensors", + "model.decoder.layers.2.mlp.down_proj.scales": "model.safetensors", + "model.decoder.layers.2.mlp.down_proj.weight": "model.safetensors", + "model.decoder.layers.2.mlp.gate_proj.biases": "model.safetensors", + "model.decoder.layers.2.mlp.gate_proj.scales": "model.safetensors", + "model.decoder.layers.2.mlp.gate_proj.weight": "model.safetensors", + "model.decoder.layers.2.mlp.up_proj.biases": "model.safetensors", + "model.decoder.layers.2.mlp.up_proj.scales": "model.safetensors", + "model.decoder.layers.2.mlp.up_proj.weight": "model.safetensors", + "model.decoder.layers.2.post_attention_layernorm.weight": "model.safetensors", + "model.decoder.layers.2.self_attn.k_proj.biases": "model.safetensors", + "model.decoder.layers.2.self_attn.k_proj.scales": "model.safetensors", + "model.decoder.layers.2.self_attn.k_proj.weight": "model.safetensors", + "model.decoder.layers.2.self_attn.o_proj.biases": "model.safetensors", + "model.decoder.layers.2.self_attn.o_proj.scales": "model.safetensors", + "model.decoder.layers.2.self_attn.o_proj.weight": "model.safetensors", + "model.decoder.layers.2.self_attn.q_proj.biases": "model.safetensors", + "model.decoder.layers.2.self_attn.q_proj.scales": "model.safetensors", + "model.decoder.layers.2.self_attn.q_proj.weight": "model.safetensors", + "model.decoder.layers.2.self_attn.v_proj.biases": "model.safetensors", + "model.decoder.layers.2.self_attn.v_proj.scales": "model.safetensors", + "model.decoder.layers.2.self_attn.v_proj.weight": "model.safetensors", + "model.decoder.layers.3.input_layernorm.weight": "model.safetensors", + "model.decoder.layers.3.mlp.down_proj.biases": "model.safetensors", + "model.decoder.layers.3.mlp.down_proj.scales": "model.safetensors", + "model.decoder.layers.3.mlp.down_proj.weight": "model.safetensors", + "model.decoder.layers.3.mlp.gate_proj.biases": "model.safetensors", + "model.decoder.layers.3.mlp.gate_proj.scales": "model.safetensors", + "model.decoder.layers.3.mlp.gate_proj.weight": "model.safetensors", + "model.decoder.layers.3.mlp.up_proj.biases": "model.safetensors", + "model.decoder.layers.3.mlp.up_proj.scales": "model.safetensors", + "model.decoder.layers.3.mlp.up_proj.weight": "model.safetensors", + "model.decoder.layers.3.post_attention_layernorm.weight": "model.safetensors", + "model.decoder.layers.3.self_attn.k_proj.biases": "model.safetensors", + "model.decoder.layers.3.self_attn.k_proj.scales": "model.safetensors", + "model.decoder.layers.3.self_attn.k_proj.weight": "model.safetensors", + "model.decoder.layers.3.self_attn.o_proj.biases": "model.safetensors", + "model.decoder.layers.3.self_attn.o_proj.scales": "model.safetensors", + "model.decoder.layers.3.self_attn.o_proj.weight": "model.safetensors", + "model.decoder.layers.3.self_attn.q_proj.biases": "model.safetensors", + "model.decoder.layers.3.self_attn.q_proj.scales": "model.safetensors", + "model.decoder.layers.3.self_attn.q_proj.weight": "model.safetensors", + "model.decoder.layers.3.self_attn.v_proj.biases": "model.safetensors", + "model.decoder.layers.3.self_attn.v_proj.scales": "model.safetensors", + "model.decoder.layers.3.self_attn.v_proj.weight": "model.safetensors", + "model.decoder.norm.weight": "model.safetensors", + "model.projection.biases": "model.safetensors", + "model.projection.scales": "model.safetensors", + "model.projection.weight": "model.safetensors", + "model.text_embeddings.biases": "model.safetensors", + "model.text_embeddings.scales": "model.safetensors", + "model.text_embeddings.weight": "model.safetensors" + } +} \ No newline at end of file diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_a.txt b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_a.txt new file mode 100755 index 0000000..7ef228b --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_a.txt @@ -0,0 +1 @@ +Coffee's story likely begins in Ethiopia, where legend tells of a goat herder named Kaldi who noticed his goats became energetic after eating red berries from a particular bush. Curious, he tried them himself, and felt invigorated. \ No newline at end of file diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_a.wav b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_a.wav new file mode 100755 index 0000000..c3eb7ce --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_a.wav @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5901d2ee3a8282fefac96d28bea2f843da5b1c9673b6d3264ccdc3c6dbec5d2e +size 636564 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_b.txt b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_b.txt new file mode 100755 index 0000000..7ef228b --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_b.txt @@ -0,0 +1 @@ +Coffee's story likely begins in Ethiopia, where legend tells of a goat herder named Kaldi who noticed his goats became energetic after eating red berries from a particular bush. Curious, he tried them himself, and felt invigorated. \ No newline at end of file diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_b.wav b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_b.wav new file mode 100755 index 0000000..799fb2b --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_b.wav @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:478de94e01ee64b69b4865d6b64540c5840bb2aca9513ececca379a8cd633532 +size 635540 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_de.txt b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_de.txt new file mode 100755 index 0000000..1fbe01d --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_de.txt @@ -0,0 +1 @@ +Ich werde bald mehrere Sprachen sprechen, darunter auch Deutsch. \ No newline at end of file diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_de.wav b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_de.wav new file mode 100755 index 0000000..6fd0f6d --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_de.wav @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ea5f7cce5506dc9707dc5048a056fe67cf0da0cae528e4e69c4662c74e75f9a3 +size 200768 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_fr.txt b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_fr.txt new file mode 100755 index 0000000..ff3683e --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_fr.txt @@ -0,0 +1 @@ +J'ai toujours cru qu’un étrange voleur joyeux mangeait rapidement cinq gâteaux exquis près du vieux phare. \ No newline at end of file diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_fr.wav b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_fr.wav new file mode 100755 index 0000000..37121bd --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/prompts/conversational_fr.wav @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:985f00a09b6e66866b162c8155c7f5505a99972d5dfa2e35f86710842719120b +size 333680 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/special_tokens_map.json b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/special_tokens_map.json new file mode 100755 index 0000000..7033bdb --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/special_tokens_map.json @@ -0,0 +1,30 @@ +{ + "additional_special_tokens": [ + "<|endoftext|>", + "<|im_start|>", + "<|im_end|>", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "" + ], + "bos_token": "<|im_start|>", + "eos_token": "<|im_end|>", + "unk_token": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/tokenizer.json b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/tokenizer.json new file mode 100755 index 0000000..d187bca --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:05e0c4dbf3b0d768c82058441fb78d84340fd056fb4949cd216229ca18334bd0 +size 3523993 diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/tokenizer_config.json b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/tokenizer_config.json new file mode 100755 index 0000000..d12fa8f --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/tokenizer_config.json @@ -0,0 +1,168 @@ +{ + "add_prefix_space": false, + "added_tokens_decoder": { + "0": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "1": { + "content": "<|im_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "2": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "3": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "4": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "5": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "6": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "7": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "8": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "9": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "10": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "11": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "12": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "13": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "14": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "15": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "16": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + } + }, + "additional_special_tokens": [ + "<|endoftext|>", + "<|im_start|>", + "<|im_end|>", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "", + "" + ], + "bos_token": "<|im_start|>", + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "extra_special_tokens": {}, + "model_max_length": 8192, + "tokenizer_class": "GPT2Tokenizer", + "unk_token": "<|endoftext|>", + "vocab_size": 49152 +} diff --git a/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/vocab.json b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/vocab.json new file mode 100755 index 0000000..0f7f821 --- /dev/null +++ b/voice/mlx/Marvis-AI/marvis-tts-250m-v0.2-MLX-8bit/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:82b84012e3add4d01d12ba14442026e49b8cbbaead1f79ecf3d919784f82dc79 +size 800662