Tiki Ai

Tiki Ai

Posted via WANTED

AI Evaluation Engineer

Posted Sep 18, 2026

Role at a glance

Salary
Not Disclosed
Location
Wework, Seoul, South Korea
Work arrangement
On-site
Employment
Full-time
Experience
0–5 years

Spotted an issue?

We’ll check it against the original posting.

Log in to report

Qualifications

Required

  • LLM 평가, 학습 데이터, 합성 데이터 또는 모델 품질 분석과 관련된 실무
  • 프로젝트 경험이 있는 분
  • Benchmark, rubric, LLM-as-a-Judge, grader, verifier 등 평가 방법을 활용해 본 분
  • 평가 방법이 측정하는 역량과 평가 결과의 신뢰성을 검증하는 방법을 설명할 수 있는 분
  • 모델 출력 또는 Agent 궤적에서 실패 유형을 도출하고 데이터나 평가 개선안으로 연결할 수 있는 분
  • Python으로 데이터 처리, 모델 호출 및 실험 분석을 독립적으로 수행할 수 있는 분
  • 기본적인 실험 설계와 통계적 판단을 바탕으로 우연한 변동, 데이터 오염 및 채점 편향을 구분할 수 있는 분
  • SFT, RLVR, rubric 기반 보상 및 Agent RL 등 주요 포스트 트레이닝 방법을 이해하는 분

Preferred

  • 아래 경험을 모두 갖출 필요는 없습니다. 하나 이상의 경험이 있다면 우대합니다.
  • RLVR, rubric 기반 강화학습, Agent RL 또는 기타 포스트 트레이닝 실험 경험
  • 코드 테스트, 실행 결과, 도구 피드백 또는 환경 상태를 활용한 verifiable reward 설계 경험
  • SFT, 선호도 최적화, RLHF/RLAIF 또는 reward model 관련 경험
  • Coding, Agent, 멀티모달 또는 전문 도메인의 데이터 구축
  • 평가 경험
  • 평가 데이터 오염, grader 취약점 또는 reward hacking 문제를 발견하고 해결한 경험
  • 재현 가능한 오픈소스 코드, 데이터셋, benchmark 또는 실험 보고서를 공개한 경험

About the role

Original posting provided by Tiki Ai

View original

About the role

AI Evaluation Engineer는 LLM의 성능을 평가하고 실패 원인을 분석해, 다음 단계의 학습 데이터와 평가 체계를 설계하는 역할입니다.

모델의 역량 목표와 실제 비즈니스 시나리오를 바탕으로 평가 과제, 데이터 기준 및 채점 방식을 설계합니다. 모델 출력과 Agent 행동 궤적을 분석해 구체적인 역량 부족을 파악하고, 이를 학습 데이터와 평가 데이터의 개선으로 연결합니다. 평가와 데이터 개선이 실제 모델 성능 향상으로 이어졌는지도 실험을 통해 검증합니다.

이 포지션의 핵심은 강화학습 알고리즘 개발 자체보다 평가 체계 설계, 데이터 설계 및 실패 분석에 있습니다. SFT, RLVR, rubric 기반 보상 및 Agent RL의 기본 원리를 이해하고 학습 목표, 데이터, grader, verifier, 보상 신호와 모델 성능의 관계를 분석할 수 있는 분을 찾습니다.

경력 연차나 기존 직무명으로 지원자를 제한하지 않습니다. 과거 직함보다 직접 수행한 프로젝트, 실제 기여 범위, 판단 과정과 검증 방법을 중요하게 평가합니다.

What you'll do

모델 및 비즈니스 목표를 검증 가능한 역량 항목, 평가 과제, 난이도 분포와 평가 기준으로 구체화합니다.
평가 과제, rubric, grader, verifier 및 Human Evaluation 프로세스를 설계하고 일관성, 안정성과 변별력을 검증합니다.
모델 출력, 도구 호출 기록 및 Agent 궤적을 분석해 문제의 원인이 모델, 데이터, 평가 과제, grader 또는 실행 환경 중 어디에 있는지 진단합니다.
실패 사례를 바탕으로 학습 데이터, 합성 데이터 및 평가 데이터를 설계하고 개선합니다.
코드 실행, 테스트 결과, 도구 피드백, 환경 상태 또는 rubric을 활용한 평가·보상 신호를 설계하고 검증합니다.
평가 데이터 오염, grader 취약점 및 reward hacking 가능성을 발견하고 개선합니다.
대조 실험, 표본 검토 및 기초 통계 분석을 통해 개선 효과가 실제로 유효한지 판단합니다.
Python을 활용해 데이터 처리, 모델 호출, 배치 평가, 자동 검증 및 결과 분석을 수행하고 실험의 추적 가능성과 재현성을 관리합니다.

Requirements

LLM 평가, 학습 데이터, 합성 데이터 또는 모델 품질 분석과 관련된 실무·프로젝트 경험이 있는 분
Benchmark, rubric, LLM-as-a-Judge, grader, verifier 등 평가 방법을 활용해 본 분
평가 방법이 측정하는 역량과 평가 결과의 신뢰성을 검증하는 방법을 설명할 수 있는 분
모델 출력 또는 Agent 궤적에서 실패 유형을 도출하고 데이터나 평가 개선안으로 연결할 수 있는 분
Python으로 데이터 처리, 모델 호출 및 실험 분석을 독립적으로 수행할 수 있는 분
기본적인 실험 설계와 통계적 판단을 바탕으로 우연한 변동, 데이터 오염 및 채점 편향을 구분할 수 있는 분
SFT, RLVR, rubric 기반 보상 및 Agent RL 등 주요 포스트 트레이닝 방법을 이해하는 분
명확한 문서 작성과 협업 능력, 독립적인 업무 추진 능력을 갖춘 분
4년제 대학 학사 이상인 분 — 전공 무관

Preferred qualifications

아래 경험을 모두 갖출 필요는 없습니다. 하나 이상의 경험이 있다면 우대합니다.

RLVR, rubric 기반 강화학습, Agent RL 또는 기타 포스트 트레이닝 실험 경험
코드 테스트, 실행 결과, 도구 피드백 또는 환경 상태를 활용한 verifiable reward 설계 경험
SFT, 선호도 최적화, RLHF/RLAIF 또는 reward model 관련 경험
Coding, Agent, 멀티모달 또는 전문 도메인의 데이터 구축·평가 경험
평가 데이터 오염, grader 취약점 또는 reward hacking 문제를 발견하고 해결한 경험
재현 가능한 오픈소스 코드, 데이터셋, benchmark 또는 실험 보고서를 공개한 경험

Benefits

GPT, Claude, Gemini 등 주요 AI 모델을 활용할 수 있는 실험 환경
모델 평가와 데이터 개선을 위한 컴퓨팅 자원 지원
평가 과제, 데이터 기준 및 개선 방향을 직접 제안할 수 있는 업무 환경
유연 근무제 실행
업계 최고 수준의 장비, 교육비 제공
경쟁력 있는 보상과 회사 성장 공유

Hiring process

서류전형 -> [과제 또는 사전 인터뷰(필요한 경우)] -> 직무 인터뷰 -> 컬처 인터뷰 -> 처우 협의 -> 최종합격

Tiki Ai

About the company

Tiki Ai

Tiki AI는 AI 연구소와 기업이 전문가의 지식을 측정 가능한 모델 성능 향상으로 전환하도록 돕는 AI 데이터·평가 전문 기업입니다. 추론, 코딩, AI Agent, 로보틱스, 멀티모달 및 AI 정렬 분야에서 전문가 중심의 데이터·평가 프로그램을 설계합니다.단순한 벤치마크 점수보다 모델이 실제 업무에서 만들어내는 가치를 중요하게 생각합니다. 모델의 실패 지점을 먼저 진단하고, 전문 지식과 사람의 판단을 적용하며, 기준선과 미사용 데이터를 통해 개선 효과를 검증합니다. 데이터 사이언티스트, AI 엔지니어 및 다양한 산업·연구 분야의 전문가들이 더 정확하고 안전하며 책임감 있게 작동하는 AI를 만들기 위해 함께하고 있습니다.