휴멜로

휴멜로

Posted via WANTED

[R&D] AI Research Engineer, Speech, STT, TTS

Posted Oct 1, 2026

Role at a glance

Job function
AI & Data Machine Learning Engineering
Salary
Not Disclosed
Location
Seoul, South Korea
Work arrangement
On-site
Employment
Full-time
Experience
3–8 years

Spotted an issue?

We’ll check it against the original posting.

Log in to report

Qualifications

Required

  • 음성합성(TTS)
  • 음성인식(ASR)
  • 대화 시스템
  • LLM 중 하나 이상에서 석사 이상 또는 박사과정 수준의 연구 경험
  • 석사 학위자 기준 관련 연구
  • 개발 경력 3년 내외 이상
  • 박사 학위 소지자 또는 박사 졸업 예정자 연차 유연 검토
  • PyTorch 등 딥러닝 프레임워크로 모델을 직접 설계

Preferred

  • 핵심 연구 역량
  • Full-duplex / conversational / streaming TTS 중 한 축 이상의 연구
  • 구현 경험(barge-in, turn-taking 포함)
  • LLM 기반 TTS 모델 이해
  • 구현 경험(VALL-E, NaturalSpeech, XTTS, Bark, Spark-TTS, CosyVoice, F5-TTS 계열)
  • Discrete audio codec / neural vocoder 구현 경험(HiFi-GAN, BigVGAN, Vocos, SoundStream, Encodec 등)
  • Voice cloning, speaker adaptation, emotional
  • prosodic TTS 관련 경험

About the role

Original posting provided by 휴멜로

View original

About the role

휴멜로는 "목소리의 미래"를 만드는 음성 AI 기업입니다. 음성 합성(TTS), 음성 변환(Voice Conversion), 음성 분석 등 음성 기술의 핵심 영역을 연구·제품화하고 있으며, 자체 개발·운영하는 TTS 엔진 DIVE를 중심으로 B2B·B2C 제품을 전개하고 있습니다.

DIVE는 짧은 레퍼런스 음성만으로 화자의 목소리를 복제하고, 48kHz 스튜디오급 음질을 실시간 스트리밍으로 합성하는 휴멜로의 자체 TTS 엔진입니다. 단발 발화 합성에서는 이미 프로덕션 검증을 마친 단계이며, 현재는 멀티턴 대화 환경에서도 맥락을 읽고 자연스럽게 말하는 Conversational TTS로 확장하는 연구를 진행하고 있습니다.

휴멜로는 2018년 창립 이후 꾸준한 연구개발을 통해 voice cloning, zero-shot TTS, prosody control, streaming synthesis 등 음성 AI 기술을 제품으로 연결해 왔습니다. KT의 AI Voice Studio / 마이 AI 보이스, SM엔터테인먼트 AI 아티스트 나이비스(nævis), 스마일게이트 협업, 밀리의서재 오디오북 등 다양한 실제 서비스 환경에서 기술을 검증해 왔고, 현재는 개발자용 음성 AI API·SaaS와 B2C 오디오 스토리 제품까지 검증 루프를 넓혀 가고 있습니다.

B2B 축에서는 개발자용 TTS API·SaaS인 Prosody Console과 상담·콜센터용 온프레미스 AICC 솔루션 TiVA를 개발하고 있습니다. Prosody Console은 DIVE의 합성 파이프라인을 외부 서비스에 내장하는 진입점이며, 고객사의 실제 트래픽을 통해 TTFB·RTF·사용량·피드백 지표를 수집합니다. TiVA는 AICC·IVR·콜센터 시나리오를 겨냥한 차세대 대화형 음성 AI 솔루션입니다.

B2C 축에서는 AI 캐릭터와 음성으로 대화하는 인터랙티브 오디오 스토리 서비스 Tikita를 웹·iOS·Android로 운영하고 있습니다. Tikita는 실제 사용자의 멀티턴 대화 데이터와 음성 사용 지표를 확인할 수 있는 제품이며, DIVE의 다음 연구 주제를 발견하고 검증하는 실사용 환경입니다.

휴멜로의 연구는 논문에서 끝나지 않습니다. 모델 구조, 데이터, 평가 방법을 설계하고, 그 결과를 Prosody Console·Tikita에 배포해 실제 사용자의 피드백과 지표로 검증합니다. 연구 성과는 1저자 논문 투고와 특허 출원까지 이어지는 것을 목표로 합니다.

주요 고객사·파트너
KT · LG전자 · LG U+ · LG CNS · 삼성SDS · SM엔터테인먼트 · 스마일게이트 · 카카오페이 · KBS · MBC
보이저엑스(Vrew) · 이스트소프트(Perso) · 팀벨(AICC 파트너) · 밀리의서재 · 딥브레인AI · 셀렉트스타 · 비디오스튜

주요 성과 및 인정
* 2026 딥테크 TIPS 선정
* 2025 글로벌 K-FAST 얼라이언스 선정
* 2024 Post-TIPS 선정
* 2023 KOREA AI STARTUP TOP100 선정
* 2022 KT Partner Award 대상
* 2022 KT DIGICO 공모전 선정

주요 투자사
FuturePlay · KT인베스트먼트 · 카카오인베스트먼트 · KDB캐피탈

관련 보도
* [Let's 스타트업] 휴멜로, 대화 맥락·감정까지 살린 보이스 AI로 승부 (매일경제, 2026)
* "맥락 파악해 목소리 톤·템포 조율…보이스 AI 시대 열겠다" (매일경제, 2025)
* 휴멜로, TTS 음질 '48kHz 스튜디오'급으로 업샘플링하는 기술 공개 (바이라인네트워크, 2025)
* AI 기업 휴멜로, LLM 아닌 '니치'에서 길 찾았다…보이스에 집중해 자체 파운데이션 모델 (테크M, 2025)
* [쫌아는기자들] 감정을 표현하고 노래도 하는 음성합성 엔진, 휴멜로 (조선일보, 2021)

What you'll do

DIVE의 차세대 대화형 TTS를 함께 설계·구현합니다. 멀티턴 대화 환경에서도 자연스럽게 동작하는 TTS로 확장하는 것이 다음 단계 목표이며, 이 과정에서 아키텍처·평가·데이터 전반의 의사결정에 주도적으로 참여합니다.

DIVE는 화자·운율·언어를 분리된 조건으로 다루는 모듈화 구조를 지향합니다. Kyutai Moshi, NVIDIA PersonaPlex 같은 full-duplex 계열과 Qwen-Omni, Step-Audio, MiniCPM-o 같은 S2S·omni-modal 계열은 대화 맥락 인지에서 강점을 보이지만, 일체형 end-to-end 구조에서는 화자·운율·감정 제어가 어려운 경우가 많습니다. 휴멜로는 DIVE가 가진 세밀한 제어 가능성을 유지하면서, 멀티턴 맥락 인지와 full-duplex·barge-in·turn-taking 같은 대화 상호작용까지 안정적으로 확보하는 방향을 탐색합니다.

또한 자체 Bandwidth Extension(BWE) 모델을 고도화합니다. DIVE는 임의 샘플레이트 음성을 48kHz 스튜디오급으로 복원하는 자체 BWE 모델을 보유하고 있으며, 현재 모델은 내부 벤치마크 기준 실시간 처리 요건을 충분히 만족하는 속도를 확보했습니다. 이번 과제에서는 이를 실시간 대화 스트리밍 흐름에 더 자연스럽게 결합되도록 점진 처리에 최적화된 구조로 재설계하고, 복원 품질을 한 단계 더 끌어올립니다.

연구 문제

1. 맥락 인지와 제어 가능성의 양립
* 멀티턴 대화 맥락을 반영하면서도 화자·운율·감정·언어 조건을 외부에서 제어할 수 있는 TTS 구조
* end-to-end S2S 모델의 맥락 인지 강점과 cascaded/modular TTS의 제어 가능성을 함께 가져가는 아키텍처
* 48kHz 스튜디오급 음질과 내부 벤치마크 기준 TTFB 300ms 이하의 실시간 스트리밍 수준 유지

2. 대화 상호작용을 위한 스트리밍 구조
* full-duplex, barge-in, turn-taking 환경에서 안정적으로 동작하는 TTS 디코딩 흐름
* VAD, turn-taking policy, streaming scheduler, tokenizer, vocoder가 함께 맞물리는 저지연 음성 대화 파이프라인
* Prosody Console·Tikita 실사용 트래픽 기반의 latency, quality, user feedback 검증

3. 자체 BWE 모델의 고도화와 스트리밍화
* 임의 샘플레이트 음성을 48kHz 스튜디오급으로 복원하는 자체 Bandwidth Extension 모델 개선
* 배치 모델 수준의 복원 품질과 실시간 대화 스트리밍에 적합한 점진 처리 구조의 양립
* BWE 품질 지표와 실제 제품 청취 품질 사이의 평가 루프 설계

구체 업무

* 멀티턴 맥락을 조건으로 입력받는 TTS 아키텍처 설계·구현
* Full-duplex·barge-in·turn-taking 안정성을 위한 스트리밍 디코딩, 음성 토크나이저·보코더, VAD/turn-taking policy, latency scheduling 구조 개선
* 자체 BWE 모델의 복원 품질 고도화와 스트리밍 흐름에 맞춘 구조 재설계
* Prosody Console·Tikita 트래픽 데이터와 자체 코퍼스를 활용한 학습·검증 파이프라인 설계
* 연구 결과를 Prosody Console·Tikita에 A/B 배포하고 TTFB·RTF·사용량·피드백 지표로 검증
* 연구 성과의 1저자 논문 투고 및 핵심 기법의 특허 출원

Requirements

* 음성합성(TTS)·음성인식(ASR)·대화 시스템·LLM 중 하나 이상에서 석사 이상 또는 박사과정 수준의 연구 경험
* 석사 학위자 기준 관련 연구·개발 경력 3년 내외 이상
* 박사 학위 소지자 또는 박사 졸업 예정자 연차 유연 검토
* PyTorch 등 딥러닝 프레임워크로 모델을 직접 설계·학습·추론해 본 경험
* 수백~수천 시간 규모의 음성 데이터를 학습에 활용해 본 경험, 또는 그에 준하는 데이터 정제·증강·평가 파이프라인 경험
* 딥러닝과 음성 신호처리의 기초 이해(STFT, mel-spectrogram, F0, prosody)
* 영어 논문을 독해·재현할 수 있는 역량과 1저자 논문 작성 의지

Preferred qualifications

핵심 연구 역량
* Full-duplex / conversational / streaming TTS 중 한 축 이상의 연구·구현 경험(barge-in, turn-taking 포함)
* LLM 기반 TTS 모델 이해·구현 경험(VALL-E, NaturalSpeech, XTTS, Bark, Spark-TTS, CosyVoice, F5-TTS 계열)
* Discrete audio codec / neural vocoder 구현 경험(HiFi-GAN, BigVGAN, Vocos, SoundStream, Encodec 등)
* Voice cloning, speaker adaptation, emotional·prosodic TTS 관련 경험
* Top-tier 1저자 논문 실적(Interspeech, ICASSP, TASLP, NeurIPS, ICML, ICLR, ACL, EMNLP 등)

제품화·최적화 역량
* 추론 최적화 경험(양자화 GGUF·GPTQ·AWQ·INT8, torch.compile, vLLM, llama.cpp 등)
* 대규모 음성 데이터셋 정제·필터링·평가 자동화 경험
* 오픈소스 기여 이력(PyTorch, HuggingFace, ESPnet 등)
* 관련 기술 특허 발명자 이력

도메인 이해
* 한국어 음운론 실무 경험(자·모음 체계, 분절음·초분절음, 운율)
* AICC·IVR·콜센터 도메인 이해
* B2C 음성 대화 제품 또는 캐릭터 음성 제품 경험

Benefits

연구 인프라
* A100 기반 자체 학습 클러스터 — 추론 서버와 분리된 실험·학습 환경
* 10만 시간 규모의 자체 다국어 학습 코퍼스 접근 권한 — 한국어 중심, 자체 수집 + 라이선스 + 공공데이터
* Prosody Console·Tikita 실사용 트래픽 기반 A/B 배포 경로 — 연구 결과의 실제 서비스 환경 검증
* 실시간 TTFB·RTF·사용량·사용자 피드백 수집 데이터베이스
* NVIDIA GPU 클러스터와 x86/ARM(Apple Silicon) CPU 다중 아키텍처 벤치마크 환경
* 국내외 학회 참가비·출장비 전액 지원 — 1저자 논문 투고·발표 전 과정 지원
* 사내 리뷰·콜로키움 세션 — 논문 작성 전 피드백 및 공동 저자 협업 지원

제품 검증 환경
* Prosody Console — 개발자용 음성 AI API·SaaS와 고객사 프로덕션 트래픽
* Tikita — AI 캐릭터와 음성으로 대화하는 B2C 인터랙티브 오디오 스토리 서비스
* TiVA — 상담·콜센터 시나리오를 겨냥한 온프레미스 AICC 솔루션
* 연구 결과를 실제 제품에 빠르게 이식하고 지표로 검증하는 B2B·B2C 듀얼 루프

근무 환경
* 전문연구요원 편입 가능
* 시차출퇴근제 — 출근 7:00-11:00, 회의·협업 시간 11:00-16:00 중심
* 주 1회 재택근무
* 과학기술인공제회 퇴직연금 가입
* 4대 보험
* 경조사비, 설·추석 상여금
* MacBook Pro, 듀얼 모니터, GPU·연구 장비 지원
* Claude Code·Codex·Cursor 등 AI 개발 도구 사내 라이선스
* 강남역 4번 출구 도보 3분 근무지

Hiring process

1. 서류 전형 — 자유양식 국문 또는 영문 이력서, 논문·arXiv·GitHub·포트폴리오 등 보완 자료 제출 환영
2. 1차 실무진 인터뷰(60-90분) — 연구 경험·접근 방식·프로젝트 히스토리 중심의 기술 인터뷰, 대면/온라인 선택 가능
3. 필요시 과제 전형 — 대화형·저지연 TTS 관련 주제
4. 2차 리더십 인터뷰(60분) — 경영진과 비전·문제 해결 방식·협업 방식 논의
5. 필요시 레퍼런스 체크 — 후보자 사전 동의 후 진행
6. 처우 협의
7. 최종 합격 및 온보딩

유의사항
* 역량과 경험에 따른 전형 축소·생략 또는 추가 인터뷰 가능
* 국가유공자 및 장애인 등 취업 보호 대상자 관련 법령에 따른 우대
* 지원 서류 허위 사실 확인 시 합격 취소 가능
* 제출 서류의 채용 검증 목적 이용 및 채용절차법 준수

휴멜로

About the company

휴멜로

휴멜로(Humelo)는 AI 음성 기술로 사람과 AI가 목소리로 만나는 장면을 제품으로 만드는 팀입니다. 출발점은 Voice AI였습니다. TTS, 보이스클로닝, 음성 변환, 감정 표현, 실시간 스트리밍 음성 합성 같은 문제를 오래 다뤄왔고, KT AI Voice Studio, SM엔터테인먼트 AI 아티스트 ‘나이비스(naevis)’ 음성 제작, 스마일게이트 협업 등 실제 서비스 환경에서 기술을 검증해 왔습니다. 지금은 목소리를 잘 만드는 것에서 한 걸음 더 나아가고 있습니다. 사용자의 말을 듣고, 대화의 맥락을 이해하고, 그 맥락에 맞는 목소리로 다시 응답하는 음성 AI 제품을 만듭니다. Prosody는 기업이 쓰는 보이스 에이전트 플랫폼입니다. STT, LLM 기반 대화 흐름, TTS를 연결해 AICC, 콜봇, 보이스봇을 테스트하고 구축할 수 있습니다. 상담 스킬과 지식 문서를 바탕으로 음성 에이전트를 만들고, 실제 고객 응대에 가까운 흐름을 설계할 수 있게 합니다. Tikita는 유저가 매일 만지는 AI 캐릭터 보이스 채팅 서비스입니다. 사용자는 AI 캐릭터와 대화하고, 스토리의 흐름을 선택하고, 캐릭터의 감정과 말투가 살아 있는 음성으로 콘텐츠를 경험합니다. 웹과 Android/iOS 앱에서 만날 수 있고, 크리에이터가 캐릭터형 콘텐츠를 만들고 운영하는 공간으로도 커지고 있습니다. Tikita는 단순한 쇼케이스가 아닙니다. 유저가 캐릭터와 대화하고, 보이스를 듣고, 스토리에 반응하는 실제 제품입니다. 여기서 나오는 반응은 다시 DIVE, FRTTS, Conversational TTS 연구와 제품 개선으로 이어집니다. 휴멜로의 자체 음성 엔진 DIVE는 짧은 레퍼런스 음성으로도 자연스러운 목소리를 만들고, 감정과 운율을 반영한 음성을 생성하는 기술입니다. FRTTS는 빠른 응답성과 품질이 중요한 서비스 환경에서 실시간 음성 합성을 가능하게 합니다. 최근에는 멀티턴 대화에서도 맥락을 읽고 자연스럽게 반응하는 Conversational TTS로 기술을 넓히고 있습니다. 휴멜로의 연구는 데모에서 멈추지 않습니다. 모델 구조, 데이터, 평가 방법을 설계하고, 그 결과를 Prosody Console과 Tikita에 반영해 실제 사용자 반응과 지표로 검증합니다. 좋은 모델을 만드는 일과 사람들이 계속 쓰는 제품을 만드는 일을 분리하지 않습니다. 팀도 그렇게 일합니다. 연구, 엔지니어링, 프로덕트, 디자인, 마케팅이 작은 팀 안에서 밀도 높게 붙어 움직입니다. Tikita 마케팅에서는 AI 도구로 광고 소재와 카피를 빠르게 만들고, 성과 데이터를 보고, 인플루언서 협업과 콘텐츠 운영을 실험합니다. R&D에서는 Prosody와 Tikita의 실제 사용 환경을 보며 다음 음성 모델의 문제를 찾습니다. 휴멜로는 누적 35억원 이상의 투자를 유치했고, KT인베스트먼트, 카카오인베스트먼트, 퓨처플레이, KDB캐피탈 등으로부터 가능성을 인정받았습니다. 우리가 더 중요하게 보는 건 AI 음성 기술이 실제 제품 안에서 어디까지 쓸모 있어질 수 있는가입니다. 음성 AI의 다음 시장은 아직 정해져 있지 않습니다. 기업 상담을 바꿀 수도 있고, 캐릭터와 스토리 경험을 바꿀 수도 있고, 사람이 AI와 대화하는 방식을 새로 만들 수도 있습니다. 휴멜로는 그 일을 직접 제품으로 만들고 있습니다. 기술을 데모에서 끝내지 않고 제품으로 만들고 싶은 분, AI 도구를 실제 업무 방식 안에 녹여 더 빠르게 실험하고 싶은 분, 음성 AI가 만들어낼 새로운 사용자 경험을 직접 보고 싶은 분이라면 휴멜로에서 큰 임팩트를 만들 수 있습니다. 당신이 꿈꾸는 모든 목소리, 그리고 AI와 사람이 대화하는 새로운 방식. 휴멜로가 함께 실현해가고 있습니다. [Products] - Prosody Console: STT·LLM·TTS 통합 보이스 에이전트 플랫폼 - Tikita: AI 캐릭터 보이스 채팅 및 인터랙티브 스토리 플랫폼 [Links] - Humelo: https://humelo.com - Prosody: https://console.humelo.com - Tikita: https://tikita.ai [Investment] - 누적 투자 유치: 35억원 이상 - 주요 투자사: KT인베스트먼트, 카카오인베스트먼트, 퓨처플레이, KDB캐피탈