Role at a glance
- Salary
- Not Disclosed
- Location
- 강남빌딩 20층, Seoul, South Korea
- Work arrangement
- On-site
- Employment
- Full-time
- Experience
- 2–8 years
Spotted an issue?
We’ll check it against the original posting.
Qualifications
Required
- Production Engineering: 프로덕션 소프트웨어를 설계, 구현, 테스트, 배포하고 운영 중 문제를 디버깅
- 개선한 경험
- Programming: Rust 또는 Go 중 하나 이상의 언어를 사용한 소프트웨어 개발 역량
- Relevant Systems: API Gateway, 분산 시스템, Kubernetes controller/operator, ML/LLM serving 중 하나 이상의 영역에서 소프트웨어를 개발한 경험
- Engineering Judgment: 성능이나 신뢰성 문제를 지표와 재현 가능한 실험으로 정의하고 개선한 경험
- Engineering Ownership: 단위/E2E 테스트와 CI/CD 자동화로 변경 사항을 검증하고, 설계 결정
- 진행 상황
- 위험 요소와 결과를 구체적으로 공유하는 분
Preferred
- AI Infrastructure: vLLM, SGLang, llm-d, Dynamo 등 LLM serving 시스템의 내부 구조를 이해하거나 관련 오픈소스에 기여한 경험
- Distributed Inference: KV cache, continuous batching, disaggregated serving, prefix-aware routing을 설계하거나 최적화한 경험
- Cloud Native: Kubernetes custom operator, scheduler 또는 OpenTelemetry 기반 observability 시스템을 개발한 경험
- AI-Native Engineering: AI Agent를 개발 workflow에 적용하고, 자동화된 테스트와 검증을 통해 개발 속도나 품질을 개선한 경험
About the role
Original posting provided by 모레
About the role
• Moreh는 특정 하드웨어에 종속되지 않고 다양한 AI 인프라를 효율적으로 활용할 수 있는 시스템을 개발합니다.
• Product 팀은 고성능 분산 추론 프레임워크인 MoAI Inference Framework를 개발합니다. 이 포지션은 LLM API 요청, 추론 엔진, 클러스터 상태를 연결하는 프로덕션 소프트웨어를 설계하고 구현합니다.
• 후보자의 강점과 경험에 따라 Performance Gateway, Inference Control Plane/Operator, Observability 중 하나 이상의 영역을 담당하며, 경력과 역량에 따라 기술적 의사결정을 주도합니다.
What you'll do
1. Performance Gateway 개발
• LLM API 호환성, 요청 라우팅, fallback/retry, backpressure와 부하 분산 기능을 설계·구현하고 검증합니다.
• Disaggregated Inference, Prefix-cache-aware routing 등 분산 추론 기법을 실제 워크로드에 적용하고 성능과 안정성을 개선합니다.
2. Inference Autopilot 개발
• 서비스 구성(Preset)을 선언적으로 관리하는 Kubernetes Operator를 설계·개발합니다.
• 트래픽 패턴과 클러스터 상태에 따라 추론 서비스의 구성 변경과 스케일링을 자동화하고, 변경의 안정성을 검증합니다.
3. High-Fidelity Observability 구축
• OpenTelemetry 기반 traces, metrics, logs를 설계하고, 분산 환경의 장애와 성능 저하를 재현하여 근본 원인을 분석합니다.
Requirements
• Production Engineering: 프로덕션 소프트웨어를 설계, 구현, 테스트, 배포하고 운영 중 문제를 디버깅·개선한 경험
• Programming: Rust 또는 Go 중 하나 이상의 언어를 사용한 소프트웨어 개발 역량
• Relevant Systems: API Gateway, 분산 시스템, Kubernetes controller/operator, ML/LLM serving 중 하나 이상의 영역에서 소프트웨어를 개발한 경험
• Engineering Judgment: 성능이나 신뢰성 문제를 지표와 재현 가능한 실험으로 정의하고 개선한 경험
• Engineering Ownership: 단위/E2E 테스트와 CI/CD 자동화로 변경 사항을 검증하고, 설계 결정·진행 상황·위험 요소와 결과를 구체적으로 공유하는 분
Preferred qualifications
• AI Infrastructure: vLLM, SGLang, llm-d, Dynamo 등 LLM serving 시스템의 내부 구조를 이해하거나 관련 오픈소스에 기여한 경험
• Distributed Inference: KV cache, continuous batching, disaggregated serving, prefix-aware routing을 설계하거나 최적화한 경험
• Cloud Native: Kubernetes custom operator, scheduler 또는 OpenTelemetry 기반 observability 시스템을 개발한 경험
• AI-Native Engineering: AI Agent를 개발 workflow에 적용하고, 자동화된 테스트와 검증을 통해 개발 속도나 품질을 개선한 경험
Benefits
• 복지포인트 연간 200만 원
• 입사 시 장비지원금 지원
• 유연출근제&재택근무
• 연 1회 종합건강검진 (본인 및 직계가족 1인)
• 생일 반차 휴가
• 장기근속 휴가
• 사내 동호회 지원 (보드게임, 클라이밍 등)
• 오피스 간식 제공 (과자, 음료수 등)
• 연말 오피스 클로징 (매년 12/28-12/31 유급휴가 제공)
• 중소기업 청년 소득세 감면 (연간 최대 200만 원)
Hiring process
• 서류전형 -> 1차 면접 -> 2차면접 -> 처우협의 ->최종합격
• 포지션에 따라 전형이 변경 또는 추가될 수 있는 점 참고 부탁드립니다.
About the company
모레
Moreh는 커스텀 커널부터 분산 서빙까지, AMD GPU, Tenstorrent 칩, 이기종 클러스터에서 최고의 추론 성능을 이끌어내는 풀스택 소프트웨어를 개발하고 있습니다. [Why Moreh?] 1. 비(非) NVIDIA 가속기에서의 추론 : 커널부터 클러스터 프레임워크까지, AMD GPU에 최적화되고 Tenstorrent 칩에서의 추론을 가능하게 하는 풀스택 소프트웨어 2. 이기종 GPU 추론 : 벤더, 아키텍처, 세대가 다른 GPU를 하나의 추론 클러스터로 통합하여 데이터센터의 모든 칩 효율을 극대화 3. 추론 비용 최적화 : 칩 레벨 최적화, 통신 최적화, 멀티 벤더 인프라 활용을 통해 달러당 토큰 수를 극대화 훌륭한 동료들과 함께 Moreh의 다음 성장을 이끌어갈 분들의 관심과 지원 기다리겠습니다 :) Join our team, be part of Moreh and be part of future!