Algorithm - Serving System Researcher
About the Role
Model Compression Part는 NPU 기반 inference의 roofline 자체를 개선하는 방법을 연구합니다. 6개월~2년 뒤에 제품에 적용될 수 있는 도전적인 과제를 스스로 정의하고 탐색하며, POC와 prototyping까지 검증한 뒤 제품화 단계는 SW 조직과 협업하여 완성합니다.
AI datacenter는 지금 큰 전환점에 있습니다. 수십~수백 개의 칩을 연동하는 cluster-level serving, AFD(Attention-FFN Disaggregation), 그리고 heterogeneous computing system 같은 기존의 틀을 넘어서는 시도들이 빠르게 등장하고 있습니다. 이런 시스템은 실제로 구현해서 실험하는 비용이 매우 큽니다. 우리는 구현에 앞서 analytical modeling과 simulation으로 설계 공간을 탐색하고 타당성을 검증하는 능력이 이 경쟁의 승부처가 될 것이라 판단하고, 여기에 베팅하고 있습니다.
Serving System Researcher는 가설 수립부터 실기기 검증까지의 연구 사이클 전체를 다루되, 무게중심이 모델링과 분석에 있는 포지션입니다. 모델링·시뮬레이션으로 설계 공간을 넓게 탐색하고, 핵심 가설은 자사 NPU 위에서 직접 확인합니다. 특정 코드베이스나 프레임워크에 매이지 않고, 문제 해결에 필요한 도구를 그때그때 선택합니다 — simulator 기반의 roofline 분석에 집중하는 달이 있는가 하면, NPU 위에서의 구현에 몰입하는 달도 있습니다. 이 포지션을 정의하는 것은 작업의 형태가 아니라 질문입니다: "이 서빙 시스템은 어떤 workload에서 우위를 갖는가? 그것을 가장 빠르고 저렴하게 증명하려면 무엇이 필요한가?"
Responsibilities
Cluster-level serving system, heterogeneous computing system 등 차세대 NPU serving의 굵직한 기술 챌린지를 발굴하고 연구 과제로 정의합니다.
Analytical modeling, roofline 분석, cost model과 자체 개발 simulator를 통해 serving 아키텍처와 알고리즘의 design space를 탐색하고, 성능·비용을 정량적으로 평가하여 핵심 의사결정에 필요한 근거를 만듭니다.
Scheduling, batching, KV cache 관리, disaggregation 등 serving algorithm을 구상하고 모델링·실험과 NPU 기반 구현으로 검증하며, 유망성이 확인된 아이디어는 POC/prototype으로 발전시켜 제품화를 위해 SW 조직과 협업합니다.
Minimum Qualifications
AI/ML, Computer Architecture 또는 관련 분야의 석사 학위 소지(예정)자 혹은 이에 준하는 경험이 있으신 분
LLM inference의 동작 원리(attention, KV cache, prefill/decode, batching, multi-chip parallelism 등)와 성능 특성에 대한 이해가 있으신 분
Python, PyTorch 등을 활용하여 performance modeling, simulation, 데이터 기반 분석을 수행할 수 있으신 분
정답이 알려지지 않은 모호한 문제를 스스로 구조화하고, 가설-검증 사이클을 주도적으로 돌릴 수 있으신 분
분석 결과와 기술적 판단을 명확한 문서와 발표로 전달할 수 있으신 분
Preferred Qualifications
분산 시스템, cluster-level software 또는 대규모 workload의 성능 분석·최적화 경험이 있으신 분
vLLM, SGLang, TensorRT-LLM 등 LLM serving system의 내부 구조에 대한 이해가 있으신 분
Roofline analysis, analytical performance model, TCO 분석 등 정량적 시스템 평가 경험이 있으신 분
GPU/NPU 등 accelerator 기반 시스템의 최적화 또는 개발 경험이 있으신 분
AI coding 도구를 활용한 개발과 연구에 익숙하신 분
이런 환경에서 일하게 됩니다
이 포지션이 잘 맞는지 판단하실 수 있도록, 우리 팀의 일하는 방식을 솔직하게 적습니다.
불확실성이 기본값입니다. 우리는 채택 여부가 보장되지 않는 미래 기술에 베팅합니다. 수개월 탐색한 방향이 "안 되는 이유"를 밝히는 것으로 끝나기도 하며, 우리는 그것도 중요한 연구 성과로 간주합니다.
작업의 형태가 계속 변합니다. 논문 읽기, 수식 유도, simulator 코딩, 실기기 실험, 발표 자료 작성이 모두 업무이며, 컴퓨터 아키텍처부터 serving 알고리즘, 데이터센터 경제성까지 공부해야 할 범위도 계속 바뀝니다. 특정 도구나 형태의 일에 대한 선호보다, 문제 자체에 대한 흥미가 오래 일하는 원동력이 됩니다.
연구는 보고서로 끝나지 않습니다. 우리의 분석과 POC는 차세대 제품 의사결정의 근거로 사용됩니다.
Contact
recruit@furiosa.ai