Role at a glance
- Salary
- Not Disclosed
- Location
- 강남빌딩 20층, Seoul, South Korea
- Work arrangement
- On-site
- Employment
- Full-time
- Experience
- 0–4 years
Spotted an issue?
We’ll check it against the original posting.
Qualifications
Required
- 컴퓨터공학 또는 관련 분야 석사 또는 박사 학위 소지자로서 우수한 연구 성과를 보유한 분
- Python 기반 소프트웨어 개발 경험
- AI 시스템 소프트웨어 또는 분산 시스템에 대한 이해
- LLM 및 생성형 AI 기술에 대한 이해
- 새로운 기술을 빠르게 학습하고 실험할 수 있는 역량
- 문제를 정의하고 가설 수립, 실험 설계, 결과 분석을 주도적으로 수행할 수 있는 역량
- 팀워크를 중시하고, 긍정적인 태도로 동료들과 적극적으로 협력할 수 있으신 분
Preferred
- 1. 연구 경험
- ML Systems, Computer Architecture, Distributed Systems, Operating Systems, Compiler, Database 등 관련 분야 연구 경험
- AI 추론 최적화 기술(KV Cache Compression, Speculative Decoding, Routing, Quantization, Parallelism 등) 연구 경험
- 주요 학술대회(NSDI, OSDI, SOSP, EuroSys, ASPLOS, ISCA, MICRO, HPCA, MLSys, NeurIPS, ICML, ICLR 등) 논문 게재 또는 이에 준하는 연구 성과
- 2. 시스템 및 GPU 프로그래밍
- CUDA, ROCm, Triton, OpenCL, TileLang 등 GPU 프로그래밍 경험
- GPU/NPU 기반 성능 최적화 경험
- 컴퓨터 아키텍처 또는 가속기 시스템 관련 연구 경험
About the role
Original posting provided by 모레
About the role
Moreh는 AMD/NVIDIA GPU 및 다양한 AI 가속기로 구성된 대규모 이기종(Heterogeneous) 클러스터에서 고성능·고효율 AI 추론 서비스를 제공하기 위한 시스템 소프트웨어를 개발하고 있습니다.
Research Engineer는 최신 LLM 및 AI Agent 기술을 분석하고, 대규모 추론 워크로드를 효율적으로 처리하기 위한 시스템 아키텍처와 최적화 기법을 연구·개발합니다. 또한 최신 논문 및 오픈소스 프로젝트를 기반으로 새로운 추론 기술을 검증하고 실제 서비스 환경에 적용 가능한 형태로 발전시키는 역할을 수행합니다.
What you'll do
1. AI Agent Research
• 오픈소스 모델 기반 AI Agent 및 Coding Agent 시스템 연구·개발
• Agent Workflow 설계 및 성능 평가 체계 구축
• 최신 Agent 기술 및 오픈소스 프로젝트 분석·적용
• Agent Serving 및 Multi-Agent System 연구
2. AI Inference Systems Research
• KV Cache Compression, Speculative Decoding, Semantic Routing, Prefix Caching 등 최신 추론 최적화 기술 연구
• LLM 추론 워크로드 분석 및 성능 모델링
• 최신 추론 프레임워크(vLLM, SGLang 등) 분석 및 개선
• 추론 품질(Quality), 비용(Cost), 지연시간(Latency) 간 Trade-off 분석
• 대규모 GPU/NPU 클러스터 환경에서의 추론 시스템 설계 및 최적화
• 최신 AI 시스템 논문 구현, 검증 및 성능 평가
Requirements
• 컴퓨터공학 또는 관련 분야 석사 또는 박사 학위 소지자로서 우수한 연구 성과를 보유한 분
• Python 기반 소프트웨어 개발 경험
• AI 시스템 소프트웨어 또는 분산 시스템에 대한 이해
• LLM 및 생성형 AI 기술에 대한 이해
• 새로운 기술을 빠르게 학습하고 실험할 수 있는 역량
• 문제를 정의하고 가설 수립, 실험 설계, 결과 분석을 주도적으로 수행할 수 있는 역량
• 팀워크를 중시하고, 긍정적인 태도로 동료들과 적극적으로 협력할 수 있으신 분
Preferred qualifications
1. 연구 경험
• ML Systems, Computer Architecture, Distributed Systems, Operating Systems, Compiler, Database 등 관련 분야 연구 경험
• AI 추론 최적화 기술(KV Cache Compression, Speculative Decoding, Routing, Quantization, Parallelism 등) 연구 경험
• 주요 학술대회(NSDI, OSDI, SOSP, EuroSys, ASPLOS, ISCA, MICRO, HPCA, MLSys, NeurIPS, ICML, ICLR 등) 논문 게재 또는 이에 준하는 연구 성과
2. 시스템 및 GPU 프로그래밍
• CUDA, ROCm, Triton, OpenCL, TileLang 등 GPU 프로그래밍 경험
• GPU/NPU 기반 성능 최적화 경험
• 컴퓨터 아키텍처 또는 가속기 시스템 관련 연구 경험
• GPU Kernel 개발 또는 성능 분석 경험
• 대규모 분산 추론 시스템 구축 및 운영 경험
3. AI 및 오픈소스
• LLM Agent 또는 AI Application 개발 경험
• LLM Evaluation Framework 및 Benchmark 구축 경험
• vLLM, SGLang, TensorRT-LLM 등 추론 프레임워크 개발 경험
• AI 관련 오픈소스 프로젝트 기여 경험
Benefits
• 복지포인트 연간 200만 원
• 입사 시 장비지원금 지원
• 유연출근제&재택근무
• 연 1회 종합건강검진 (본인 및 직계가족 1인)
• 생일 반차 휴가
• 장기근속 휴가
• 사내 동호회 지원 (보드게임, 클라이밍 등)
• 오피스 간식 제공 (과자, 음료수 등)
• 연말 오피스 클로징 (매년 12/28-12/31 유급휴가 제공)
• 중소기업 청년 소득세 감면 (연간 최대 200만 원)
Hiring process
• 서류전형 -> 1차 면접 -> 2차면접 -> 처우협의 ->최종합격
• 포지션에 따라 전형이 변경 또는 추가될 수 있는 점 참고 부탁드립니다.
About the company
모레
Moreh는 커스텀 커널부터 분산 서빙까지, AMD GPU, Tenstorrent 칩, 이기종 클러스터에서 최고의 추론 성능을 이끌어내는 풀스택 소프트웨어를 개발하고 있습니다. [Why Moreh?] 1. 비(非) NVIDIA 가속기에서의 추론 : 커널부터 클러스터 프레임워크까지, AMD GPU에 최적화되고 Tenstorrent 칩에서의 추론을 가능하게 하는 풀스택 소프트웨어 2. 이기종 GPU 추론 : 벤더, 아키텍처, 세대가 다른 GPU를 하나의 추론 클러스터로 통합하여 데이터센터의 모든 칩 효율을 극대화 3. 추론 비용 최적화 : 칩 레벨 최적화, 통신 최적화, 멀티 벤더 인프라 활용을 통해 달러당 토큰 수를 극대화 훌륭한 동료들과 함께 Moreh의 다음 성장을 이끌어갈 분들의 관심과 지원 기다리겠습니다 :) Join our team, be part of Moreh and be part of future!