GLM-4-Voice (Zhipu AI) 상세 정보
📌 모델 개요
GLM-4-Voice는 칭화대 연구진 스핀오프 기업인 지푸 AI(Zhipu AI)가 오픈소스로 공개한 엔드투엔드(End-to-End) 실시간 음성 대화 파운데이션 모델입니다.
🔍 상세 심층 분석
중간 텍스트 변환(STT -> LLM -> TTS) 파이프라인의 딜레이를 거치지 않고, 음성 파형(Audio Waveform)을 직접 입력받아 지연 시간 없이 자연스러운 억양과 감정이 담긴 음성으로 즉시 응답합니다.
심층 특징:
- 초저지연 실시간 음성 응답: 사람이 전화 통화하는 것과 구분이 불가능할 정도의 빠른 반응 속도와 인터럽트(끼어들기) 기능을 지원합니다.
- 감정 및 음색 제어: 속삭임, 흥분, 침착함 등 다양한 감정 톤과 말하는 속도를 유연하게 조절할 수 있습니다.
- 오픈소스 가중치 공개: 연구자와 개발자가 자체 음성 어시스턴트를 온프레미스에 구축할 수 있도록 모델 가중치를 완전 공개했습니다.
🔗 관련 링크
- 공식 깃허브: GLM-4-Voice GitHub
- 지푸 AI 오픈 플랫폼: Zhipu AI BigModel