Skip to content

GLM-4-Voice (Zhipu AI) 상세 정보

🔙 이전 화면으로 돌아가기


📌 모델 개요

GLM-4-Voice는 칭화대 연구진 스핀오프 기업인 지푸 AI(Zhipu AI)가 오픈소스로 공개한 엔드투엔드(End-to-End) 실시간 음성 대화 파운데이션 모델입니다.

🔍 상세 심층 분석

중간 텍스트 변환(STT -> LLM -> TTS) 파이프라인의 딜레이를 거치지 않고, 음성 파형(Audio Waveform)을 직접 입력받아 지연 시간 없이 자연스러운 억양과 감정이 담긴 음성으로 즉시 응답합니다.

심층 특징:

  • 초저지연 실시간 음성 응답: 사람이 전화 통화하는 것과 구분이 불가능할 정도의 빠른 반응 속도와 인터럽트(끼어들기) 기능을 지원합니다.
  • 감정 및 음색 제어: 속삭임, 흥분, 침착함 등 다양한 감정 톤과 말하는 속도를 유연하게 조절할 수 있습니다.
  • 오픈소스 가중치 공개: 연구자와 개발자가 자체 음성 어시스턴트를 온프레미스에 구축할 수 있도록 모델 가중치를 완전 공개했습니다.

🔗 관련 링크


🔙 이전 화면으로 돌아가기

개발자를 위한 지식DB — 더 나은 개발 경험을 위해