Role at a glance
- Salary
- Not Disclosed
- Location
- 강남빌딩 20층, Seoul, South Korea
- Work arrangement
- On-site
- Employment
- Full-time
- Experience
- 1+ years
Spotted an issue?
We’ll check it against the original posting.
Qualifications
Required
- 컴퓨터공학 혹은 관련 전공 학부 졸업, 혹은 이와 동등한 경력이 있으신 분
- 시스템 소프트웨어 개발 혹은 활용 경험이 있으신 분
- LLM 추론 과정에 대한 기본적인 이해가 있으신 분
- 팀워크를 중시하고, 긍정적인 태도로 동료들과 적극적으로 협력할 수 있으신 분
Preferred
- AI 가속기(GPU, TPU, NPU 등) 환경에서의 추론 및 최적화 경험이 있으신 분
- LLM 서빙 프레임워크를 직접 개발하거나 관련 오픈 소스 프로젝트(vLLM, SGLang, Transformers 등)에 기여한 경험이 있으신 분
- NCCL, NIXL, UCX 등의 low-level 통신 라이브러리 활용 및 개발 경험이 있으신 분
- 대규모 시스템에서의 분산 처리, 모니터링, 성능 분석 및 해결 경험이 있으신 분
About the role
Original posting provided by 모레
About the role
• Moreh는 대규모 GPU/NPU 클러스터에서 다양한 LLM을 서빙하는 “토큰 팩토리” 데이터센터를 효율적으로 구동하기 위한 추론 소프트웨어를 개발, 제공합니다.
• LLM Inference Engineer는 이종 GPU 클러스터에서 LLM 추론을 고성능으로 실행할 수 있도록 다양한 분산 추론 기술을 개발, 통합, 배포하는 업무를 담당합니다.
What you'll do
• 다수의 노드와 이기종 가속기를 활용해, LLM 추론 워크로드를 효율적으로 실행할 수 있는 실행 환경 구축
• LLM 서빙 프레임워크(vLLM, SGLang 등)의 성능 최적화
• 스토리지, 메모리, GPU 간 고속 통신을 위한 low-level 라이브러리(NCCL, NIXL, UCX 등)의 활용 및 최적화
• 효율적인 KV cache 오프로딩 및 티어링
• GPU를 효율적으로 활용하기 위한 라우팅 규칙 개발, 적용
• 하드웨어 특성과 서비스 요구를 모두 고려한 병목 분석 및 시스템 성능 개선
Requirements
• 컴퓨터공학 혹은 관련 전공 학부 졸업, 혹은 이와 동등한 경력이 있으신 분
• 시스템 소프트웨어 개발 혹은 활용 경험이 있으신 분
• LLM 추론 과정에 대한 기본적인 이해가 있으신 분
• 팀워크를 중시하고, 긍정적인 태도로 동료들과 적극적으로 협력할 수 있으신 분
Preferred qualifications
• AI 가속기(GPU, TPU, NPU 등) 환경에서의 추론 및 최적화 경험이 있으신 분
• LLM 서빙 프레임워크를 직접 개발하거나 관련 오픈 소스 프로젝트(vLLM, SGLang, Transformers 등)에 기여한 경험이 있으신 분
• NCCL, NIXL, UCX 등의 low-level 통신 라이브러리 활용 및 개발 경험이 있으신 분
• 대규모 시스템에서의 분산 처리, 모니터링, 성능 분석 및 해결 경험이 있으신 분
Benefits
• 복지포인트 연간 200만 원
• 입사 시 장비지원금 지원
• 유연출근제&재택근무
• 연 1회 종합건강검진 (본인 및 직계가족 1인)
• 생일 반차 휴가
• 장기근속 휴가
• 사내 동호회 지원 (보드게임, 클라이밍 등)
• 오피스 간식 제공 (과자, 음료수 등)
• 연말 오피스 클로징 (매년 12/28-12/31 유급휴가 제공)
• 중소기업 청년 소득세 감면 (연간 최대 200만 원)
Hiring process
• 서류 전형 -> 1차 면접 -> 최종 면접 -> 처우 협의 -> 최종 합격
• 포지션에 따라 전형이 변경 또는 추가될 수 있는 점 참고 부탁드립니다.
About the company
모레
Moreh는 커스텀 커널부터 분산 서빙까지, AMD GPU, Tenstorrent 칩, 이기종 클러스터에서 최고의 추론 성능을 이끌어내는 풀스택 소프트웨어를 개발하고 있습니다. [Why Moreh?] 1. 비(非) NVIDIA 가속기에서의 추론 : 커널부터 클러스터 프레임워크까지, AMD GPU에 최적화되고 Tenstorrent 칩에서의 추론을 가능하게 하는 풀스택 소프트웨어 2. 이기종 GPU 추론 : 벤더, 아키텍처, 세대가 다른 GPU를 하나의 추론 클러스터로 통합하여 데이터센터의 모든 칩 효율을 극대화 3. 추론 비용 최적화 : 칩 레벨 최적화, 통신 최적화, 멀티 벤더 인프라 활용을 통해 달러당 토큰 수를 극대화 훌륭한 동료들과 함께 Moreh의 다음 성장을 이끌어갈 분들의 관심과 지원 기다리겠습니다 :) Join our team, be part of Moreh and be part of future!