Whisper API et MCP : comment ajouter la reconnaissance vocale à votre projet
Whisper est un modèle de synthèse vocale. NeuralSpace propose les modèles suivants : Whisper large-v3, Whisper. Ils fonctionnent tous via une seule API publique et il existe un serveur MCP prêt pour les agents IA. La clé est délivrée lePage des clés API. Vous trouverez ci-dessous les capacités du modèle, des exemples de requêtes et les étapes de configuration.
Ce que Whisper peut faire
Whisper transcrit la parole d'un fichier audio et renvoie le texte. La demande est envoyée sous forme de données multipart/form avec un champ de fichier et le modèle Whisper-large-v3 (l'identifiant Whisper-1 fonctionne de manière transparente comme large-v3). mp3, mp4, mpeg, mpga, m4a, wav, webm, ogg et flac sont pris en charge, jusqu'à 25 Mo. Le prix est par minute d'audio.
Point de terminaison de l'API
Envoyez une demande à POST /v1/audio/transcriptions. Exemple : multipart/form-data: file (audio), model=whisper-large-v3. L'autorisation utilise une clé API dans l'en-tête x-api-key. ID de modèle disponible : whisper-large-v3, whisper-1.

Outils MCP
Le serveur NeuralSpace MCP est disponible sur POST /mcp (Streamable HTTP). Pour travailler avec Whisper, un agent utilise les outils : transcribe_audio, list_models, get_balance. Cela permet à Claude Code, Cursor et d'autres clients MCP d'utiliser directement les modèles de site.
Comment se connecter
Inscrivez-vous sur NeuralSpace, ouvrez lePage des clés APIet créez une clé nsk-…. Transmettez-le ensuite dans l'en-tête de la requête ou dans les paramètres de votre client MCP. La documentation complète est sur lela page /v1/docs.
FAQ
Quels formats audio sont pris en charge ?
mp3, mp4, mpeg, mpga, m4a, wav, webm, ogg et flac.
Quelle est la taille maximale du fichier ?
25 Mo.
Quel est le format de la demande ?
POST /v1/audio/transcriptions en tant que multipart/form-data avec un champ de fichier.