Streaming Speech-to-Speech & Voice Clone Simulator
Zero-Shot d-Vector
Kotoba Tech simultaneous acoustic transfer & latency budget workbench
Presets:
Ultra-Low (250ms)
Balanced (485ms)
Broadcast (1200ms)
Streaming Ingest & Timbre Parameters
▶ Simulate Stream & Audio
Audio Chunk
350 ms
Timbre Window
1.2 s
Speaker F0
145 Hz
Formant Shift
1.04x
Language Pair
English ➔ Japanese (日本語)
English ➔ Spanish (Español)
English ➔ German (Deutsch)
English ➔ French (Français)
English ➔ Mandarin (中文)
Source:
"We have been building speech to speech simultaneous translation for a while."
Target:
"私たちはしばらくの間、音声から音声への同時通訳を構築してきました。"
Pipeline Latency Breakdown
● Simultaneous Real-Time
Chunk Buffer
350ms
Ingestion
Stream ASR
45ms
Conformer
Neural MT
20ms
Wait-k=2
d-Vector Enc
10ms
Zero-Shot
Vocoder
60ms
HiFi-GAN
Total Latency
485 ms
Timbre Cosine Sim
0.89
Embedding Stability
0.92
Est. BLEU Quality
38.4
Enjoy this tool? Build your own with Super