704 / 707
Laya: 빠른 판단을 위한 오픈소스 의사결정 모델
일반적인 거대 언어 모델(LLM)은 질문에 대한 긴 답변을 생성한다. 하지만 많은 비즈니스 상황에서는 신속하고 구조화된 판단이 필요하며, 긴 답변보다는 빠른 결정이 중요하다. Laya는 이러한 요구에 부응하기 위해 설계된 오픈소스 비자기회귀형 의사결정 모델이다.
Laya, 텍스트 생성 대신 확률을 반환한다
Laya는 텍스트를 생성하는 대신, 입력에 대한 여러 질문을 한 번의 순전파로 처리한다. 이 모델은 각 선택지별 확률, 점수, 또는 특정 조건이 참일 확률을 직접 반환한다. 고객 문의의 담당 부서 배정, 피싱 판별, 긴급도 평가처럼 신속한 판단이 필요한 작업에 주로 활용한다.
Laya는 양방향 인코더 기반으로 동작한다. 자체 GPU 측정에서 질문 하나를 처리하는 데 32.8ms가 소요된다. 질문 10개를 배치 처리할 때는 질문당 7.2ms라는 매우 빠른 속도를 기록한다. 영어용, 다국어용, 업무 특화 모델과 코드를 Apache-2.0 라이선스로 공개해 누구나 자체 서버에서 실행하고 업무 데이터로 미세조정할 수 있다. 업무 판단 벤치마크 학습 데이터로 미세조정했을 때 정확도 76.6%를 기록했으며, 언어별 모델 라우팅과 업무에 맞춘 확률 보정 기능도 제공한다.
Jev에 대한 비판과 시스템 1 접근
Laya 개발진은 2025년 3월 공개한 판매 대화 의사결정 모델에서 출발했다. 이 모델은 시퀀스 표현에 PPO를 적용해 대화 턴별 전환 확률을 출력했다. 이후 2025년 9월 강화학습이 이끄는 스키마 기반 의사결정 프레임워크를 정식화한 두 번째 논문을 공개했다.
개발진은 TypeSafe AI의 Jev가 같은 비자기회귀형 의사결정 개념을 새로운 돌파구처럼 내세운 점에 불만을 표했다. TypeSafe AI는 OpenAI의 챗GPT 공동 발명에 참여한 Diogo Almeida가 설립한 기업이다. Jev는 2026년 9월 출시 당시 기술 논문, 공개 가중치, 공개 학습 데이터셋 없이 출시되었다. RLCD(Reinforcement Learning for Calibrated Decisions)를 이용한 병렬 샘플링으로 확신도 분포와 스키마 선택을 출력한다. Jev의 요금은 입력 100만 토큰당 0.042달러이며, 일반적인 응답 시간은 약 150ms이다.
Laya 개발진은 기존 구조의 한계를 고친 범용 모델군 Laya를 개발했다. 그들은 생성형 LLM을 호출하지 않고 단순하고 구조화된 판단을 즉시 수행하는 System 1 접근 방식을 지향한다. 지원 티켓 부서 배정, 피싱/스팸 판별, 탈옥/프롬프트 주입 탐지, 긴급도 평가, 코드 실행 필요 여부 등이 대상이다. 생성형 모델을 사용하면 토큰 출력에 500~2,000ms를 기다려야 하고, 추론 비용과 정규식/JSON 파싱 부담까지 감수해야 한다. 또한 LLM이 생성한 “confidence: 0.95”는 확신 있어 보이는 토큰 예측일 뿐, 그 자체로 수학적 확률 보정을 보장하지 않는다.
Laya의 세 가지 의사결정 기본형
Laya는 원문 텍스트, 이메일, 티켓, JSON 문서를 입력 상태로 받아 한 번의 순전파에서 여러 유형의 질문을 평가한다. 출력은 확률과 숫자로 제한되며 텍스트를 생성하지 않는다. 개발진은 이 구조가 생성형 환각과 스키마 위반, 잘못된 JSON 출력을 배제한다고 말한다.
다음은 Laya가 제공하는 세 가지 의사결정 기본형이다.
| 의사결정 유형 | 설명 | 반환값 |
|---|---|---|
| choice | 기준 사전에서 하나의 선택지를 고른다. | 선택된 키, 전체 선택지의 확률 분포, 보정된 확신도 |
| score | 0, 1, 2 등 순서형 평가 척도에서 상태를 평가한다. | 기대 수준, 각 등급의 확률 분포, 확신도 |
| noul | 불리언 질문에 대해 P(true)를 반환한다. | 0.0~1.0의 P(true), P(false)는 1 - P(true)로 구조적 성립 |
다양한 Laya 모델과 선택적 다운로드
Laya는 세 가지 주요 체크포인트 모델을 제공한다. 이들은 단일 Hugging Face 저장소에 묶여 있으며, SDK가 allow_patterns 기능을 이용해 요청한 하위 폴더만 다운로드한다. 전체 약 2.5GB 대신 영어 모델은 약 808MB, 다국어 모델은 약 647MB만 받을 수 있다. 가중치는 Apache 2.0으로 공개돼 API 구독 없이 자체 호스팅할 수 있다.
| 모델명 | 기반 모델 | 매개변수 | 문맥 길이 | 초점/대상 | 특징 |
|---|---|---|---|---|---|
| Laya English | ModernBERT-large | 421M | 512 | 영어 분류, 가드레일, 이메일 분류 | 기본 영어 체크포인트 |
| Laya Multilingual | mmBERT-base | 322M | 1,024 (최대 8k 지원) | 100개 이상 언어, 언어 간 자연어 추론(NLI) | 영어용 대비 2.2배 빠른 속도 |
| Laya Typed Decisions | ModernBERT-large | 421M | 1,024 | 에이전트 관측 가능성, 고객 서비스, 청구서 처리, 보안 경보 | 미세조정 후 정확도 0.766 기록 |
확신도보다 중요한 언어 라우팅
MASSIVE 51개 언어 평가에서 Laya는 중요한 문제점을 발견했다. 영어용 ModernBERT-large의 5만 토큰 BPE 어휘는 비라틴 문자에서 심각한 성능 저하를 보인다. 예를 들어 크메르어는 정확도 0.000, 평균 확신도 0.952를 기록하며 100개 질문을 모두 틀렸다. 아르메니아어는 정확도 0.050, 확신도 0.885, 히브리어는 정확도 0.060, 확신도 0.964를 보였다. 벵골어는 정확도 0.080, 확신도 0.945, 힌디어는 정확도 0.100, 확신도 0.941이다.
이는 영어 체크포인트가 정확도와 무관하게 평균 확신도가 0.885 아래로 내려가지 않는다는 의미이다. 입력 문자를 제대로 읽지 못하는 상황을 확신도 임계값으로 걸러낼 수 없기 때문에, 순전파 전에 사용할 모델을 결정해야 한다.
순수 Python으로 구현한 Router는 22개 문자 체계와 라틴 문자 불용어 분포를 분석한다. 데바나가리, CJK 한자, 키릴, 아랍, 히브리, 타밀, 태국 문자 등을 검사한다. 탐지 지연은 일반 영어 0.09ms, 데바나가리/인도계 문자 0.54ms, 200행 중첩 JSON 문서 0.73ms이다. Router(preload=True)는 필요한 모델을 VRAM/RAM에 상주시켜 언어가 번갈아 들어올 때 발생하는 7~10초의 콜드 스왑 지연을 없앤다. 영어는 ModernBERT-large, 힌디어 등은 mmBERT-base로 자동 분배한다. 업무 유형을 이미 알고 있다면 model="typed-decisions"로 직접 지정할 수 있다.
Jev와 Laya 성능 비교
Laya 개발진은 TypeSafe Jev 1.13.0과 Laya의 성능을 비교했다. Laya 수치는 개발진의 실측값이며, Jev 수치는 독립 평가와 TypeSafe AI 공개 자료에서 가져왔다.
| 항목 | Laya (typed-decisions) | Jev | Laya 우위 (비율/수치) |
|---|---|---|---|
| 분류 정확도 (2천 개 판단) | 0.766 | 0.727 | 3.9%p 높다 |
| AG News 4개 분류 | 0.950 | 0.910 | 4.0%p 높다 |
| DAIR Emotion 6개 분류 | 0.595 | 0.480 (Brier 0.846) | 11.5%p 높다 |
| 기대 보정 오차 (ECE) | 0.081 | 0.246 | 약 3배 우수하다 |
| 중앙값 지연 시간 (단일 질문) | 32.8ms | 236~276ms | 약 7.8배 빠르다 |
| 중앙값 지연 시간 (10개 질문 배치) | 72.3ms (질문당 7.2ms) | 약 1,500ms (순차 처리) | 약 20배 빠르다 |
| 다국어 벤치마크 | 51개 중 45개 언어 무작위 기준 3배 이상 | 공개된 벤치마크 없음 | Laya만 제공한다 |
| 배포 방식 | 오픈소스 (Safetensors 가중치) | 비공개 종량제 API | 자체 호스팅 가능하다 |
| 비용 | 자체 호스팅 시 API 사용료 없음 | 입력 100만 토큰당 0.042달러 | 비용이 없다 |
위 비교표에서 Laya는 분류 정확도, 보정 성능, 지연 시간 등 주요 지표에서 Jev보다 우수한 성능을 보인다. 특히 지연 시간에서는 단일 질문 처리 시 약 7.8배, 10개 질문 배치 처리 시 약 20배 빠른 속도를 기록한다. 또한 Laya는 오픈소스 가중치를 제공해 API 사용료 없이 자체 호스팅이 가능하다.
실제 업무 평가와 Laya의 한계점
총 9개 기업 업무 흐름을 평가했을 때, Laya는 다음과 같은 결과를 보인다.
- Enron 이메일 스팸 필터링: 정확도 0.993, F1 0.993, ECE 0.013
- 피싱 탐지: 정확도 0.980, F1 0.979, ECE 0.012
- LLM 가드레일/탈옥 탐지: 학습에서 제외한 ToxicChat에서 정확도 0.755~0.762. 선택적으로 전체의 50%만 처리할 때 정확도 0.931에 도달한다.
- RAG 구절 관련성 필터링: 단일 순전파 정확도 0.657
- 지원 티켓 10개 대기열 분류: 정확도 0.522
Laya의 choice 기능은 선택지가 20개를 넘으면 성능이 저하된다. 77개 분류의 Banking77 데이터셋에서 Laya 정확도는 0.425로 Jev의 0.870보다 낮았다. 이는 선택지 전체가 head_max_len 192~256 토큰을 공유하기 때문에, 선택지가 77개일 때는 후보당 약 3~4 토큰만 남는 구조적 제약 때문이다. 따라서 선택지를 20개 미만으로 유지하거나, 큰 범주를 먼저 고른 뒤 세부 범주를 선택하는 2단계 계층 구조를 권장한다.
미세조정 없는 기본 모델은 typed-decisions에서 무작위에 가까운 약 0.35의 정확도를 보인다. 정확도 0.766은 해당 벤치마크의 학습 분할로 미세조정한 결과이다. Laya는 범용 제로샷 정답기로 보기보다, 업무에 맞게 특화하는 빠른 기반 모델로 사용하는 편이 적절하다. 기본 가중치에는 온도 보정 전 로짓이 포함된다. 사용 도메인의 데이터 분포에 맞춰 질문 유형별로 하나의 스칼라 온도를 학습하면 ECE가 0.466에서 0.081로 줄어든다.
SDK 사용 흐름과 공개 자료
Laya SDK는 라우터와 세 가지 질문 유형을 결합한다. 서비스 장애와 요금 분쟁이 담긴 티켓 하나에 담당 대기열 choice, 긴급도 score, 이탈 위험 noul을 동시에 질의할 수 있다. 예시 출력은 영어 모델 선택, 인프라 대기열 배정과 확신도 0.96, 긴급도 2.87/3.0, 이탈 위험 91.4%를 포함한다.
개발진은 모든 AI 문제를 자기회귀형 챗봇으로 풀기보다, 대량 분류, 가드레일, 라우팅, 우선순위 분류를 빠른 양방향 의사결정 모델로 처리하는 것을 목표로 한다. RLCD 학습과 언어 라우팅, 보정된 확률을 결합해 운영 코드에서 바로 분기 조건으로 사용할 수 있는 오픈소스 대안을 지향한다.
Laya 관련 공개 자료는 다음과 같다.
- Hugging Face Model Hub: 체크포인트 3종을 묶은 저장소이다.
- Laya Demo: ZeroGPU 기반으로 8개 업무 흐름과 다국어 라우팅을 대화형으로 체험할 수 있다.
- GitHub 저장소: 코드와 라우터를 제공하며,
research브랜치에 재현 가능한 벤치마크 하네스가 있다. - PyPI 패키지: Laya Python 패키지를 제공한다.
- Kaggle 2xT4 미세조정 노트북: 무료 Kaggle GPU에서 약 4시간 동안 맞춤형 System 1 모델을 학습하는 예제이다.
출처
- 원문: https://laya.convaiinnovations.com/
- 경유: GeekNews https://news.hada.io/topic?id=33944










