← 모든 글

Whisper API 및 MCP: 프로젝트에 음성 인식을 추가하는 방법

Whisper API 및 MCP: 프로젝트에 음성 인식을 추가하는 방법

Whisper는 음성-텍스트 모델입니다. NeuralSpace는 Whisper Large-v3, Whisper 모델을 제공합니다. 모두 단일 공개 API를 통해 실행되며 AI 에이전트를 위한 준비된 MCP 서버가 있습니다. 열쇠는 다음 날에 발급됩니다.API 키 페이지. 다음은 모델 기능, 요청 예시 및 설정 단계입니다.

위스퍼가 할 수 있는 일

Whisper는 오디오 파일의 음성을 기록하고 텍스트를 반환합니다. 요청은 파일 필드와 Whisper-large-v3 모델이 포함된 multipart/form-data로 전송됩니다(Whisper-1 ID는 Large-v3으로 투명하게 작동함). mp3, mp4, mpeg, mpga, m4a, wav, webm, ogg 및 flac가 최대 25MB까지 지원됩니다. 가격은 오디오의 분당 가격입니다.

API 엔드포인트

POST /v1/audio/transcriptions에 요청을 보냅니다. 예: multipart/form-data: file (audio), model=whisper-large-v3. 승인은 x-api-key 헤더의 API 키를 사용합니다. 사용 가능한 모델 ID: whisper-large-v3, whisper-1.

A glowing sound wave folding into abstract lines

MCP 도구

NeuralSpace MCP 서버는 POST /mcp(스트리밍 가능한 HTTP)에서 사용할 수 있습니다. Whisper를 사용하기 위해 상담원은 transcribe_audio, list_models, get_balance 도구를 사용합니다. 이를 통해 Claude Code, Cursor 및 기타 MCP 클라이언트가 사이트 모델을 직접 사용할 수 있습니다.

연결 방법

NeuralSpace에 가입하고API 키 페이지nsk-… 키를 생성합니다. 그런 다음 요청 헤더나 MCP 클라이언트 설정에 전달하세요. 전체 문서는/v1/docs 페이지.

FAQ

어떤 오디오 형식이 지원되나요?

mp3, mp4, mpeg, mpga, m4a, wav, webm, ogg 및 flac.

최대 파일 크기는 얼마입니까?

25MB.

요청은 어떤 형식인가요?

파일 필드가 있는 multipart/form-data로 /v1/audio/transcriptions를 게시합니다.