카카오뱅크, LLM 서빙 및 추론 최적화 엔지니어 채용
카카오뱅크가 AI코어개발팀에서 함께 일할 LLM 서빙 및 추론 최적화 엔지니어를 모집한다. 이번 채용은 LLM 추론 서비스 개발과 운영, 모델 추론 최적화 업무를 맡을 경력자를 대상으로 진행된다. AI코어개발팀은 금융 산업에 필요한 AI 기술을 직접 개발하는 조직으로, 사용자 관점에서 필요한 서비스를 정의하고 이를 뒷받침하는 기술을 구현해 비대면 금융 생활을 지원하고 있다.
이번에 합류하는 엔지니어는 LLM 구조와 서빙 워크로드, GPU 특성을 프로파일링해 병목을 찾아내고 서비스 요구사항에 맞는 추론 시스템을 설계·구현하는 일을 하게 된다. 추론 성능과 GPU 자원 사용 현황을 모니터링하면서 모델과 엔진 변경 전후를 비교하는 회귀 테스트로 문제를 조기에 발견하는 작업도 병행한다. 또한 Kubernetes 환경에 추론 시스템을 배포·운영하며 트래픽 변화에 맞춰 요청과 GPU 자원을 효율적으로 배분하고, vLLM·SGLang 등을 기반으로 추론 서버를 구현해 서비스 환경에 맞게 구성하고 튜닝하는 역할도 담당한다. 모델 압축, KV 캐시 최적화, 요청 스케줄링, 다중 GPU 분산 추론을 적용해 성능을 끌어올리는 동시에 모델 품질 저하 여부를 확인하며, Speculative Decoding이나 Prefill/Decode Disaggregation, Expert Parallelism 같은 새로운 기법을 검토하고 워크로드에 맞게 구현·검증하는 업무까지 폭넓게 경험하게 된다.
지원 자격은 LLM 서빙 또는 추론 최적화 분야에서 2년 이상 실무 경험이 있는 경우로 정해졌다. 최신 LLM 구조와 추론 과정을 이해하고 모델·워크로드 특성에 따라 성능 병목을 찾아 최적화 방향을 정할 수 있는 역량이 필요하며, vLLM, SGLang, TensorRT-LLM, TGI 중 하나 이상을 실무에 사용하며 내부 코드를 분석·수정해 튜닝해 본 경험도 요구된다. Python을 능숙하게 다루고 추론 엔진의 최적화 기능을 직접 구현·검증할 수 있어야 하고, 모델 압축이나 KV 캐시 최적화, 서빙 시스템 최적화, 고급 추론·서빙 최적화 중 한 분야 이상을 깊이 이해하고 구현·튜닝해 본 경험이 있어야 한다. 우대사항으로는 CUDA, Triton, TileLang 등을 활용한 GPU 커널 구현·튜닝 경험, 다중 GPU 환경에서의 분산 서빙 경험, MoE·긴 문맥·멀티모달 모델 서빙 경험, LLM·NLP 분야 논문 발표나 오픈소스 기여 경험, Kubernetes 환경에서 플랫폼팀과 협업한 대규모 서비스 운영 경험, 금융 등 규제 산업에서의 보안·규제 요건 반영 경험 등이 꼽힌다.
근무지는 경기도 성남시 분당구 분당내곡로 131에 위치한 카카오뱅크 판교오피스다. 자세한 내용은 카카오뱅크의 홈페이지에서 확인할 수 있다.
카카오뱅크가 AI코어개발팀에서 함께 일할 LLM 서빙 및 추론 최적화 엔지니어를 모집한다. 이번 채용은 LLM 추론 서비스 개발과 운영, 모델 추론 최적화 업무를 맡을 경력자를 대상으로 진행된다. AI코어개발팀은 금융 산업에 필요한 AI 기술을 직접 개발하는 조직으로, 사용자 관점에서 필요한 서비스를 정의하고 이를 뒷받침하는 기술을 구현해 비대면 금융 생활을 지원하고 있다.
이번에 합류하는 엔지니어는 LLM 구조와 서빙 워크로드, GPU 특성을 프로파일링해 병목을 찾아내고 서비스 요구사항에 맞는 추론 시스템을 설계·구현하는 일을 하게 된다. 추론 성능과 GPU 자원 사용 현황을 모니터링하면서 모델과 엔진 변경 전후를 비교하는 회귀 테스트로 문제를 조기에 발견하는 작업도 병행한다. 또한 Kubernetes 환경에 추론 시스템을 배포·운영하며 트래픽 변화에 맞춰 요청과 GPU 자원을 효율적으로 배분하고, vLLM·SGLang 등을 기반으로 추론 서버를 구현해 서비스 환경에 맞게 구성하고 튜닝하는 역할도 담당한다. 모델 압축, KV 캐시 최적화, 요청 스케줄링, 다중 GPU 분산 추론을 적용해 성능을 끌어올리는 동시에 모델 품질 저하 여부를 확인하며, Speculative Decoding이나 Prefill/Decode Disaggregation, Expert Parallelism 같은 새로운 기법을 검토하고 워크로드에 맞게 구현·검증하는 업무까지 폭넓게 경험하게 된다.
지원 자격은 LLM 서빙 또는 추론 최적화 분야에서 2년 이상 실무 경험이 있는 경우로 정해졌다. 최신 LLM 구조와 추론 과정을 이해하고 모델·워크로드 특성에 따라 성능 병목을 찾아 최적화 방향을 정할 수 있는 역량이 필요하며, vLLM, SGLang, TensorRT-LLM, TGI 중 하나 이상을 실무에 사용하며 내부 코드를 분석·수정해 튜닝해 본 경험도 요구된다. Python을 능숙하게 다루고 추론 엔진의 최적화 기능을 직접 구현·검증할 수 있어야 하고, 모델 압축이나 KV 캐시 최적화, 서빙 시스템 최적화, 고급 추론·서빙 최적화 중 한 분야 이상을 깊이 이해하고 구현·튜닝해 본 경험이 있어야 한다. 우대사항으로는 CUDA, Triton, TileLang 등을 활용한 GPU 커널 구현·튜닝 경험, 다중 GPU 환경에서의 분산 서빙 경험, MoE·긴 문맥·멀티모달 모델 서빙 경험, LLM·NLP 분야 논문 발표나 오픈소스 기여 경험, Kubernetes 환경에서 플랫폼팀과 협업한 대규모 서비스 운영 경험, 금융 등 규제 산업에서의 보안·규제 요건 반영 경험 등이 꼽힌다.
근무지는 경기도 성남시 분당구 분당내곡로 131에 위치한 카카오뱅크 판교오피스다. 자세한 내용은 카카오뱅크의 홈페이지에서 확인할 수 있다.









