Audio-Text-to-Text
Transformers
Safetensors
Japanese
English
llama_for_speech_lm
japanese
speech
audio
speech-to-text
llm-jp
Instructions to use Atotti/llm-jp-4-8b-speech-chat with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Atotti/llm-jp-4-8b-speech-chat with Transformers:
# Load model directly from transformers import LlamaForSpeechLM model = LlamaForSpeechLM.from_pretrained("Atotti/llm-jp-4-8b-speech-chat", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Update README.md
Browse files
README.md
CHANGED
|
@@ -69,7 +69,7 @@ tokenizer = AutoTokenizer.from_pretrained(MODEL_ID)
|
|
| 69 |
tokenizer.pad_token = tokenizer.eos_token
|
| 70 |
|
| 71 |
# Load audio
|
| 72 |
-
waveform, sample_rate = torchaudio.load("
|
| 73 |
if waveform.size(0) > 1:
|
| 74 |
waveform = waveform.mean(dim=0, keepdim=True)
|
| 75 |
waveform = waveform.squeeze(0)
|
|
@@ -192,7 +192,7 @@ tokenizer = AutoTokenizer.from_pretrained(MODEL_ID)
|
|
| 192 |
tokenizer.pad_token = tokenizer.eos_token
|
| 193 |
|
| 194 |
# 音声読み込み
|
| 195 |
-
waveform, sample_rate = torchaudio.load("
|
| 196 |
if waveform.size(0) > 1:
|
| 197 |
waveform = waveform.mean(dim=0, keepdim=True)
|
| 198 |
waveform = waveform.squeeze(0)
|
|
|
|
| 69 |
tokenizer.pad_token = tokenizer.eos_token
|
| 70 |
|
| 71 |
# Load audio
|
| 72 |
+
waveform, sample_rate = torchaudio.load("path/to/your_audio_file.wav")
|
| 73 |
if waveform.size(0) > 1:
|
| 74 |
waveform = waveform.mean(dim=0, keepdim=True)
|
| 75 |
waveform = waveform.squeeze(0)
|
|
|
|
| 192 |
tokenizer.pad_token = tokenizer.eos_token
|
| 193 |
|
| 194 |
# 音声読み込み
|
| 195 |
+
waveform, sample_rate = torchaudio.load("path/to/your_audio_file.wav")
|
| 196 |
if waveform.size(0) > 1:
|
| 197 |
waveform = waveform.mean(dim=0, keepdim=True)
|
| 198 |
waveform = waveform.squeeze(0)
|