AI · 기술

대규모 언어 모델

Large language model

다른 표기: LLM · 거대 언어 모델

아주 많은 글을 학습해 다음에 올 말을 예측하도록 만든 모델. 요약, 번역, 글쓰기, 대화에 쓰입니다.

학습 목표는 단순합니다. 앞의 글을 보고 다음 토큰을 맞히는 것입니다. 이 단순한 목표를 아주 큰 데이터와 모델로 밀어붙이자 번역과 요약 같은 일을 따로 배우지 않고도 하게 되었습니다.

약점도 분명합니다. 모르는 것을 그럴듯하게 지어내고, 학습 시점 이후의 일을 모릅니다. 그래서 사실이 중요한 곳에서는 검색을 붙이거나 출처를 함께 보여 주어야 합니다.

교육에서는 답을 만들어 주는 용도보다, 만든 자료를 다듬고 정리하는 용도가 안전합니다. 아이에게 나가는 문장은 사람이 확인합니다.

  • 토큰 예측글자가 아니라 토큰 단위로 다음을 예측합니다.
  • 확인 절차사실이 걸린 문장은 사람이 검수합니다.

관련 용어