카카오, AI 모델 학습·경량화 기술 공개…크기 줄이고 성능은↑

IT/과학

뉴스1,

2026년 October 08일, AM 09:53

카카오 판교 아지트 포레스트 로비(카카오 제공) © 뉴스1 김민석 기자

카카오(035720)는 언어모델링 국제학회 'COLM 2026'에서 인공지능(AI) 모델의 학습 효율을 높이고
모델 경량화와 성능 향상을 동시에 구현하는 연구 성과를 발표했다고 8일 밝혔다.

COLM은 대규모 언어모델(LLM)과 언어모델링 연구를 전문적으로 다루는 국제 학회로 2024년 신설됐다.

카카오는 메인 콘퍼런스와 토크나이제이션 워크숍 'TokShop'에서 각각 성과를 소개했다.

메인 콘퍼런스에서 발표한 논문 '렛츠 스케일 스텝 바이 스텝'(Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts)에는 대규모 전문가 혼합(MoE) 모델의 사전 학습에 필요한 최적의 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 방법론을 담았다.

학습률은 AI 모델이 학습할 때 내부 설정값인 매개변수를 얼마나 크게 조정할지 정하는 값으로 학습의 안정성과 성능에 영향을 미친다.

너무 크면 학습이 불안정해지고 너무 작으면 학습 속도가 느려질 수 있어 적절한 값을 찾는 것이 중요하다.

MoE 모델은 최근 고성능 LLM의 핵심 구조로 주목받고 있다.

하지만 기존 밀집형(Dense) 모델보다 학습 설정과 방법에 대한 공개 연구가 충분하지 않아 대규모 학습 시 비용에 대한 부담이 발생할 수 있다.

카카오는 소규모 모델에서 찾은 최적의 학습 설정을 대규모 모델로 확장하는 '뮤-매개변수화' 기법을 MoE 모델 구조의 특성에 맞게 적용했다.

모델의 크기와 학습 토큰량을 단계적으로 확장해 최적의 학습률을 탐색하고 짧은 학습 구간에서 찾은 설정이 대규모 학습에서도 유효하게 적용되는 것을 검증했다.

이 방법론은 카카오의 'Kanana-2.6-155b-a17b' 모델의 사전학습에 적용돼 10조(T) 토큰까지 안정적으로 학습하는 데 활용됐다.

또 TokShop에서는 모델 크기를 줄이면서도 성능을 높인 'BBT: BPE-Guided Byte Transformer'를 공개했다.

기존 BPE(문자 조합 토큰 생성 방식) 기반 모델은 글을 읽고 답변을 생성하기 위해 수많은 단어와 단어 조각에 해당하는 정보를 저장해야 했다.

BBT는 더 작은 기본 단위인 '바이트'를 활용하는 구조로 모델의 크기를 줄이면서도 여러 문자를 묶어 효율적으로 압출 처리하는 기존 방식의 장점은 유지했다.

비교 실험에서 파라미터 수를 20.2~40.4% 줄이면서 테스트 성능을 2.7~6.6% 개선했다.

오탈자나 문자 교란에 대한 강건성을 확보하고 학습하지 않은 언어로의 전이 성능도 높였다.

온디바이스 환경에서 AI 모델의 메모리 부담을 줄이고 다국어 입력, 오탈자가 잦은 대화 환경 등에서도 안정적인 성능을 구현할 것으로 기대된다.

카카오는 다양한 모델 구조로 적용 범위를 넓히고 효율적인 방법을 고도화해 대규모 LLM의 학습 비용을 절감하겠다고 설명했다.

shushu@news1.kr

추천 뉴스