
AI
LLaDA: Diffusion language model과 LLM reversal curse
두줄요약
디퓨전 방식 언어모델 LLaDA의 학습·추론 구조와 reversal curse 완화 가능성을 다뤘습니다. 코드 FIM 태스크에서의 잠재력과 추론 효율 한계도 함께 정리했습니다.
핵심 내용
- 디퓨전 방식으로 학습하는 언어모델 LLaDA 소개
- 전체 시퀀스 attention 기반의 omni-directional 학습
- reversal curse 완화와 코드 FIM 태스크에서의 가능성
선택 이유
- auto-regressive 구조가 아닌 방식으로도 LLM 핵심 능력 구현 가능성 제시
- masking 기반 손실로 diffusion의 noise 추가와 denoising을 언어에 적용
- bi-directional 학습이 forward/reversal 성능 격차를 줄이는 사례 제시
장단점
- 장점: 전체 문맥 활용, reversal task 대응력 향상, 코드 도메인 확장성
- 단점: inference 시 전체 시퀀스 재계산, KV-cache 미사용, 대형 모델 검증 부족
적용해볼 점
- code completion과 fill-in-the-middle 문제에 특화된 모델 가능성 검토
- sampling step 조절로 품질과 처리량 사이 균형 탐색
