DHMin/raon-poc

Raon-Speech-9B PoC Repository

0

stars

0

commits

Python

primary language

Apr 19, 2026

updated

README

Raon-Speech-9B PoC

KRAFTON의 Raon-Speech-9B 모델을 Apple Silicon(MPS) 환경에서 테스트하는 PoC 프로젝트.

이 PoC는 Claude Code를 통해 기획 및 테스트되었습니다.

환경

  • 모델: KRAFTON/Raon-Speech-9B (9B 파라미터, 한/영 지원)
  • 테스트 환경: Mac Studio M4 Max, 128GB RAM
  • Device: MPS (Apple Silicon)
  • 라이선스: CC BY-NC 4.0 (비상업적 사용만 허용)

설치

uv 가 설치되어 있어야 합니다.

brew install uv
uv sync

테스트 스크립트

1. 기본 기능 테스트 (test_raon.py)

TTS → Voice Cloning → STT 순서로 기본 기능을 검증합니다.

uv run python test_raon.py

출력 파일

  • output_tts.wav — 한국어 TTS 결과
  • output_cloned.wav — Voice Cloning 결과

2. 내 목소리 복제 테스트 (record_and_test.py)

마이크로 직접 녹음 후, 내 목소리를 복제해 다른 텍스트를 생성합니다.

uv run python record_and_test.py

실행 흐름

  1. Enter 누르면 카운트다운 3초 후 15초 녹음
  2. 모델 로딩 (~7초, 캐시 기준)
  3. 내 목소리로 지정 텍스트 Voice Cloning 생성
  4. 원본 → 복제 순서로 자동 재생해서 바로 비교

출력 파일

  • my_voice.wav — 녹음 원본
  • my_voice_cloned.wav — Voice Cloning 결과

복제할 텍스트 변경 record_and_test.py 상단의 CLONE_TEXT 변수를 수정하세요.

CLONE_TEXT = "원하는 텍스트를 여기에 입력하세요."

실측 성능 (M4 Max MPS 기준)

기능RTF비고
TTS1.76실시간 대비 1.76배 소요
Voice Cloning4.07실시간 대비 4.07배 소요
모델 로딩~7초캐시 후 기준, 최초 다운로드 ~18GB

CUDA GPU(RTX 6000 Pro) 기준 RTF 0.27 — MPS 대비 약 6~15배 빠름

테스트 결과 (2026-04-20)

TTS

  • 입력: "안녕하세요. 저는 크래프톤의 Raon 음성 모델입니다."
  • 출력: output_tts.wav (40.9초) | 소요: 71.9초 | RTF: 1.76

Voice Cloning

  • reference: output_tts.wav (모델 자체 생성 음성)
  • 입력: "이 목소리는 방금 생성된 음성을 복제해서 만들었습니다."
  • 출력: output_cloned.wav (9.0초) | 소요: 36.4초 | RTF: 4.07

STT

  • 입력: output_tts.wav
  • 인식 결과: "안녕하세요, 저는 크래프톤의 알에이 음성 모델입니다."
  • 영문 고유명사 "Raon""알에이" 오인식

알려진 이슈

  • MPS 텐서 → numpy 변환 시 .cpu().to(torch.float32) 필요 (bfloat16 미지원)
  • STT에서 영문 고유명사 오인식: "Raon""알에이"
  • 토큰 mismatch 경고는 무시해도 동작에 무관함

참고

DHMin/raon-poc

Raon-Speech-9B PoC Repository

0

stars

0

commits

Python

primary language

Apr 19, 2026

updated

README

Raon-Speech-9B PoC

KRAFTON의 Raon-Speech-9B 모델을 Apple Silicon(MPS) 환경에서 테스트하는 PoC 프로젝트.

이 PoC는 Claude Code를 통해 기획 및 테스트되었습니다.

환경

  • 모델: KRAFTON/Raon-Speech-9B (9B 파라미터, 한/영 지원)
  • 테스트 환경: Mac Studio M4 Max, 128GB RAM
  • Device: MPS (Apple Silicon)
  • 라이선스: CC BY-NC 4.0 (비상업적 사용만 허용)

설치

uv 가 설치되어 있어야 합니다.

brew install uv
uv sync

테스트 스크립트

1. 기본 기능 테스트 (test_raon.py)

TTS → Voice Cloning → STT 순서로 기본 기능을 검증합니다.

uv run python test_raon.py

출력 파일

  • output_tts.wav — 한국어 TTS 결과
  • output_cloned.wav — Voice Cloning 결과

2. 내 목소리 복제 테스트 (record_and_test.py)

마이크로 직접 녹음 후, 내 목소리를 복제해 다른 텍스트를 생성합니다.

uv run python record_and_test.py

실행 흐름

  1. Enter 누르면 카운트다운 3초 후 15초 녹음
  2. 모델 로딩 (~7초, 캐시 기준)
  3. 내 목소리로 지정 텍스트 Voice Cloning 생성
  4. 원본 → 복제 순서로 자동 재생해서 바로 비교

출력 파일

  • my_voice.wav — 녹음 원본
  • my_voice_cloned.wav — Voice Cloning 결과

복제할 텍스트 변경 record_and_test.py 상단의 CLONE_TEXT 변수를 수정하세요.

CLONE_TEXT = "원하는 텍스트를 여기에 입력하세요."

실측 성능 (M4 Max MPS 기준)

기능RTF비고
TTS1.76실시간 대비 1.76배 소요
Voice Cloning4.07실시간 대비 4.07배 소요
모델 로딩~7초캐시 후 기준, 최초 다운로드 ~18GB

CUDA GPU(RTX 6000 Pro) 기준 RTF 0.27 — MPS 대비 약 6~15배 빠름

테스트 결과 (2026-04-20)

TTS

  • 입력: "안녕하세요. 저는 크래프톤의 Raon 음성 모델입니다."
  • 출력: output_tts.wav (40.9초) | 소요: 71.9초 | RTF: 1.76

Voice Cloning

  • reference: output_tts.wav (모델 자체 생성 음성)
  • 입력: "이 목소리는 방금 생성된 음성을 복제해서 만들었습니다."
  • 출력: output_cloned.wav (9.0초) | 소요: 36.4초 | RTF: 4.07

STT

  • 입력: output_tts.wav
  • 인식 결과: "안녕하세요, 저는 크래프톤의 알에이 음성 모델입니다."
  • 영문 고유명사 "Raon""알에이" 오인식

알려진 이슈

  • MPS 텐서 → numpy 변환 시 .cpu().to(torch.float32) 필요 (bfloat16 미지원)
  • STT에서 영문 고유명사 오인식: "Raon""알에이"
  • 토큰 mismatch 경고는 무시해도 동작에 무관함

참고

Languages

Python

100.0%