Algorithm - Serving System Engineer
About the Role
Model Compression Part는 NPU 기반 inference의 roofline 자체를 개선하는 방법을 연구합니다. 6개월~2년 뒤에 제품에 적용될 수 있는 도전적인 과제를 스스로 정의하고 탐색하며, POC와 prototyping까지 검증한 뒤 제품화 단계는 SW 조직과 협업하여 완성합니다.
AI datacenter는 지금 큰 전환점에 있습니다. 수십~수백 개의 칩을 연동하는 cluster-level serving, AFD(Attention-FFN Disaggregation), heterogeneous computing system 등 기존의 틀을 넘어서는 새로운 serving system이 빠르게 등장하고 있습니다. 그리고 Agentic AI 시대에 multi-turn session이 기본이 되면서, 다양한 memory hierarchy를 활용해 KV cache reuse와 compression을 극대화하려는 방법들이 활발하게 제안되고 있습니다.
이런 아이디어들은 이론적 분석과 simulation으로 유망성을 가릴 수 있지만, 그 가치는 실기기 위에서 POC로 증명되기 전까지 확정되지 않습니다. Serving System Engineer는 바로 그 증명을 담당하는 역할입니다. 차세대 serving system 개념을 자사 NPU 위에 직접 구현하고, 자체 kernel programming stack과 low-level programming interface를 활용해 하드웨어의 성능을 끌어내며, 무엇이 되고 무엇이 안 되는지를 실기기 위에서 확인합니다.
구현은 이 역할의 출발점이지 전부가 아닙니다. 우리 팀에서 구현은 다음 연구를 낳는 과정입니다. 실기기 위에서만 보이는 병목과 제약, 최적화 과정에서 얻은 lesson은 새로운 연구 과제와 아이디어의 가장 좋은 원천이며, 우리는 구현을 담당한 사람이 그 통찰로 다음 과제를 제안하는 것을 적극 장려합니다. 가설 수립부터 실기기 증명까지의 사이클 전체를 다루되, 무게중심이 구현과 검증에 있는 포지션입니다.
Responsibilities
팀이 연구하는 차세대 serving system 개념(AFD, KV cache reuse 등)의 핵심 요소를 NPU 기반 구현(POC)으로 증명합니다.
최신 compression 기법(quantization, KV cache compression 등)을 탐색하고, NPU 환경에서 구현·검증합니다.
구현에서 얻은 통찰을 바탕으로 새로운 연구 과제와 최적화 아이디어를 발굴하고 제안합니다.
Minimum Qualifications
3년 이상의 관련 분야 실무 경험, 또는 이에 준하는 역량(연구·프로젝트 경험 포함)이 있으신 분
LLM inference의 동작 원리(attention, KV cache, prefill/decode, batching 등)에 대한 이해가 있으신 분
vLLM, SGLang, TensorRT-LLM 등 AI inference system에 대한 지식 또는 사용 경험이 있으신 분
CUDA, Triton 또는 accelerator programming 경험이 있으신 분
문서화된 정답이 없는 문제를 실험과 디버깅으로 돌파해 본 경험이 있으신 분
기술적 복잡성을 명확하게 소통하고, 타 팀과의 협업을 주도적으로 이끌 수 있으신 분
Preferred Qualifications
Multi-threading, memory management, performance optimization 등 low-level system 개념에 대한 이해가 있으신 분
Tensor/pipeline parallelism 등 multi-chip parallelism과 분산 inference에 대한 이해가 있으신 분
Model quantization, KV cache optimization 등 compression 기법에 대한 이해나 적용 경험이 있으신 분
딥러닝 가속화, inference platform 관련 조직에서 근무해 보신 분
AI coding 도구를 활용한 개발과 연구에 익숙하신 분
이런 환경에서 일하게 됩니다
이 포지션이 잘 맞는지 판단하실 수 있도록, 우리 팀의 일하는 방식을 솔직하게 적습니다.
선례가 거의 없는 개척 영역입니다. 우리가 구현하려는 것은 정해진 사용법을 따라가는 작업이 아니라, NPU의 low-level 스택으로 아직 아무도 시도하지 않은 가속 scheme을 실현하는 일입니다. 참고할 레퍼런스보다 직접 확인해야 할 것이 많으며, 당신이 뚫은 길과 만든 방법이 곧 팀의 표준이 됩니다.
무게중심은 구현이지만, 작업의 형태는 고정되어 있지 않습니다. 프로젝트의 단계에 따라 실기기 구현 전후로 modeling·simulation·분석 작업을 함께 수행하게 될 수 있습니다. 우리에게 이것들은 별개의 직무가 아니라 하나의 검증 사이클입니다.
불확실성이 기본값입니다. 우리는 채택 여부가 보장되지 않는 미래 기술에 베팅합니다. 공들여 구현한 기법이 제품에 채택되지 않을 수도 있으며, 그 과정에서 확보한 노하우와 "안 되는 이유"도 중요한 성과로 간주합니다.
Contact
recruit@furiosa.ai