리소리우스

리소리우스

Posted via WANTED

Data Ingestion Engineer

Posted Oct 7, 2026

Role at a glance

Job function
AI & Data Data Engineering
Salary
Not Disclosed
Location
Seoul, South Korea
Employment
Full-time
Experience
Entry Level 0–35 years

Spotted an issue?

We’ll check it against the original posting.

Log in to report

Qualifications

Required

  • Python을 활용해 데이터를 추출
  • 가공
  • 검증하고, ML 학습
  • 평가용 Dataset을 구축한 경험이 있으신 분
  • ML Task에 맞는 Sampling, Train / Validation / Test Split 및 Validation 방법을 이해하고 적용할 수 있으신 분
  • 데이터 분포, Bias, Leakage 및 Dataset Quality가 모델 성능과 평가에 미치는 영향을 이해하고, 관련 문제를 점검할 수 있으신 분
  • 가공 코드
  • 설정, 라벨, 데이터 버전을 관리하여 Dataset과 ML Experiment를 재현할 수 있으신 분

Preferred

  • Clinical, EHR/EMR, Imaging, Pathology, Omics 중 하나 이상의 Biomedical Data 처리 경험
  • Patient Cohort Definition, Clinical Outcome 또는 Longitudinal / Temporal Patient Dataset 구축 경험
  • Multi-modal ML Dataset 구축 경험
  • SQL을 활용한 코호트 추출 및 데이터 가공 경험
  • 라벨링 지침
  • 검수 기준을 정리하고, 라벨 품질과 수정 이력을 관리한 경험
  • Spark, Ray 등 대규모 데이터 처리 Framework 활용 경험
  • MLflow, DVC, Weights & Biases 등을 활용한 Dataset / Experiment Versioning 경험

About the role

Original posting provided by 리소리우스

View original

About the role

저희 팀은 복잡한 Biomedical Data를 기반으로 질병과 환자의 상태를 이해하고, 새로운 연구 가설을 발견하고 검증할 수 있는 AI Research System을 구축하고 있습니다.

Clinical/EHR, Imaging, Pathology, Omics 등 서로 다른 형태의 데이터를 통합하고, 이를 Knowledge Graph, AI Agent, World Model 및 Machine Learning Model과 연결하여 단순한 예측을 넘어 질병의 상태와 변화, 치료 반응의 원인을 이해할 수 있는 AI 시스템을 만드는 것을 목표로 합니다.

궁극적으로는 AI가 연구자의 반복적인 데이터 탐색과 분석을 보조하는 수준을 넘어, 가설 생성 Dry-lab 검증 Wet-lab 검증으로 이어지는 연구 과정의 효율성과 실험 성공 확률을 높이는 것을 목표로 합니다.

What you'll do

• 데이터셋 구축·검증 및 제공
• 연구 질문과 활용 목적을 코호트 조건, 필요 변수, 가공 규칙, 산출물과 완료 기준이 정의된 태스크로 구체화하고 Dataset 구축
• Researcher 및 Domain Expert와 함께 Label, Outcome, Prediction Target과 Feature 구성을 정의하고, 라벨링 지침·검수 기준 및 작업 결과를 데이터셋에 반영
• 평가 목적에 맞는 환자·기관·시간 기준의 Sampling 및 Train / Validation / Test Split 설계와 Data Leakage·Label Leakage 검증
• 동일 환자의 방문·검체·모달리티 간 중복 및 예측 시점 이후 정보 유입 등 태스크별 누수 위험 점검
• Longitudinal / Temporal Patient Dataset 구축 및 EHR/EMR, Imaging, Pathology, Omics 등 Multi-modal Dataset Alignment
• 결측·중복, 라벨 오류, 데이터 분포 및 코호트 선택 편향을 점검하는 Dataset Quality / Distribution Validation Pipeline 구축
• 태스크별 추출·가공·검증 과정의 자동화와 Dataset 갱신·재생성 파이프라인 운영
• 입력 데이터 버전, 가공 코드·설정, 라벨·검수 이력 및 Split 정보를 연결한 Dataset Versioning, Snapshot 및 Benchmark 관리
• 사용·제공 가능한 범위와 제공 규격에 맞춰 Dataset을 구성하고, 코호트·라벨 정의, 데이터 사전, 품질 검증 결과, 이용 범위와 버전별 변경 내역을 포함한 제공 패키지 제작
• 연구 과제별 학습 데이터 확장
• Model Error, Failure Case, Hard Example 및 평가 결과를 분석하여 Dataset 개선 과제 도출
• AI Agent의 Reasoning / Tool-use / Research Trajectory 기록 수집·정제 및 검수
• AI/ML Engineer 및 Researcher와 협업하여 SFT, Preference Learning, RL 및 Post-training Dataset 구축과 Feedback Data Loop 운영

Requirements

• Python을 활용해 데이터를 추출·가공·검증하고, ML 학습·평가용 Dataset을 구축한 경험이 있으신 분
• ML Task에 맞는 Sampling, Train / Validation / Test Split 및 Validation 방법을 이해하고 적용할 수 있으신 분
• 데이터 분포, Bias, Leakage 및 Dataset Quality가 모델 성능과 평가에 미치는 영향을 이해하고, 관련 문제를 점검할 수 있으신 분
• 가공 코드·설정, 라벨, 데이터 버전을 관리하여 Dataset과 ML Experiment를 재현할 수 있으신 분
• 반복적인 데이터 처리·검증 과정을 재사용 가능한 코드나 파이프라인으로 구현할 수 있으신 분
• AI/ML Engineer, Researcher 및 Domain Expert와 협업하여 요구사항을 구체적인 가공·검수 기준과 데이터 산출물로 구현할 수 있으신 분

Preferred qualifications

• Clinical, EHR/EMR, Imaging, Pathology, Omics 중 하나 이상의 Biomedical Data 처리 경험
• Patient Cohort Definition, Clinical Outcome 또는 Longitudinal / Temporal Patient Dataset 구축 경험
• Multi-modal ML Dataset 구축 경험
• SQL을 활용한 코호트 추출 및 데이터 가공 경험
• 라벨링 지침·검수 기준을 정리하고, 라벨 품질과 수정 이력을 관리한 경험
• Spark, Ray 등 대규모 데이터 처리 Framework 활용 경험
• MLflow, DVC, Weights & Biases 등을 활용한 Dataset / Experiment Versioning 경험
• ML Benchmark 또는 Evaluation Dataset 구축 경험
• LLM/Agent Trajectory, Instruction / SFT Dataset 구축 경험
• Preference, Reward Model, RLHF/RLAIF 등 Post-training Dataset 관련 경험
• Model Failure Case Mining, Hard Example Mining, Active Learning 또는 평가 결과를 활용한 Dataset 개선 경험
• 외부 고객이나 연구 협력자에게 제공할 Dataset의 패키징, 품질 검수 및 문서화 경험

Benefits

• 학회/세미나/교육/도서 등 구매 지원
• 식대 월 최대 40만원 지원
• 간식 지원
• 중소기업 소득세 감면 제도(5년간, 90%)
• 지하철역 도보 2분 거리 사무실
• 성과에 비례한 보상(급여 인상, 스톡옵션 등) 제공
• 만근수당 지급
• 유연출퇴근제 운영
• 그 외에 업무와 개인 성장에 필요한 전반적인 지원

Hiring process

• 1차: 대표자 커피챗
• 2차: 실무자 커피챗
• (필요 시) 기술 면접 > 레퍼런스 체크

리소리우스

About the company

리소리우스

리소리우스 (Resorius)*는 뇌파(EEG) 데이터를 기반으로 신경계 질환 진단 및 뇌과학 연구를 혁신하는 인공지능 솔루션 기업입니다. 우리는 AI 기술을 통해 의료진과 연구자가 보다 빠르고 정확한 의사결정을 내릴 수 있도록 지원하며, 신경과학의 실질적인 진보에 기여하고자 합니다. 우리가 추구하는 가치 AI 기반의 뇌질환 진단 고도화 뇌파 데이터를 정밀 분석하여 신경계 이상 징후를 조기에 탐지하고, 임상 적용 가능성을 높이는 기술을 개발하고 있습니다. 신뢰도 높은 데이터 기반 접근 다양한 신경질환에 대한 연구 데이터를 축적하고, 이를 바탕으로 정교한 모델을 훈련함으로써 높은 정확도와 재현성을 확보합니다. 협업 중심의 기술 문화 민첩한 조직 문화와 지속적인 실험 정신을 통해 사용자 중심의 문제 해결에 집중합니다. 사회적 임팩트와 미래지향적 기술 의료 사각지대 해소와 신경정신질환의 조기 진단 등, 기술의 사회적 활용 가치를 함께 고민합니다. 리소리우스는 과학과 기술이 결합된 정교한 도구를 통해, 신경과학의 새로운 가능성을 실현하고자 합니다.