📕 이 사이트를 굴린 428커밋의 기록이 상품이 됐습니다 — 전자책·스타터 키트 보기 →
agenwiki

입문

LLM이란 무엇인가: 대규모 언어 모델 쉽게 이해하기

LLM(대규모 언어 모델)이 무엇이고 어떻게 텍스트를 만들어내는지, ChatGPT·Claude 같은 서비스와 어떤 관계인지 쉬운 말로 정리합니다.

LLM(Large Language Model, 대규모 언어 모델)은 방대한 텍스트를 학습해, 주어진 문맥 다음에 올 가능성이 가장 높은 토큰을 예측하는 방식으로 문장을 만들어내는 인공지능 모델입니다. ChatGPT·Claude·Gemini 같은 대화형 서비스가 이 LLM을 기반으로 동작합니다. 사전학습으로 언어 패턴과 지식을, 정렬·튜닝으로 지시를 따르는 능력을 얻습니다.

LLM이란 무엇인가?

LLM(Large Language Model, 대규모 언어 모델)은 방대한 양의 텍스트 데이터를 학습해, 주어진 문맥 다음에 올 가능성이 가장 높은 토큰을 예측하는 방식으로 문장을 만들어내는 인공지능 모델입니다. ChatGPT, Claude, Gemini 같은 서비스가 대화형으로 답을 내놓는 것도 이 LLM을 기반으로 동작합니다. "대규모"라는 이름처럼 파라미터 수와 학습 데이터 양이 매우 크다는 점이 일반적인 자연어 처리 모델과의 차이입니다.

한마디로 요약하면, LLM은 "다음 단어를 얼마나 잘 예측하는가"를 반복 학습한 결과 문장을 이해하고 생성하는 능력을 갖추게 된 모델입니다.

LLM은 어떻게 동작하나?

LLM의 기본 동작 원리는 크게 두 단계로 나눌 수 있습니다.

  1. 사전학습(pre-training): 인터넷 문서, 책, 코드 등 대규모 텍스트를 모아 다음 토큰을 맞히는 과제를 반복 학습시킵니다. 이 과정에서 모델은 문법, 사실 지식, 문맥 이해 능력을 통계적으로 습득합니다.
  2. 정렬·튜닝: 사전학습만 마친 모델은 지시를 따르는 능력이 부족하기 때문에, 사람이 선호하는 답변 형태로 추가 조정하는 과정을 거칩니다. 이 단계를 거쳐야 질문에 대화형으로 답하는 지금의 챗봇 형태가 됩니다.

이렇게 학습된 모델은 입력 문장을 토큰 단위로 쪼갠 뒤, 각 토큰을 벡터로 바꾸고, 이전 토큰들과의 관계를 계산해 다음에 올 토큰의 확률을 예측하는 과정을 반복하며 응답을 생성합니다.

LLM은 무엇을 잘하고 무엇을 못하나?

LLM은 언어 패턴을 다루는 작업에서 강점을 보이고, 사실 검증이나 최신 정보가 필요한 작업에서는 한계를 보입니다.

  • 잘하는 일: 문서 요약, 번역, 초안 작성, 코드 생성 등 언어 패턴을 다루는 작업. 문맥에 맞춰 자연스러운 문장을 빠르게 만들어내는 능력이 핵심입니다.
  • 못하는 일: 학습 시점 이후의 최신 정보 파악, 정확한 계산·사실 검증. 근거 없이 그럴듯한 내용을 지어내는 환각 현상이 대표적 한계로 꼽힙니다.

이런 한계를 보완하기 위해 외부 문서를 검색해 답변 근거로 활용하는 RAG 같은 기법이 함께 쓰입니다.

LLM과 함께 알아둘 개념은 무엇인가?

LLM을 이해하려면 몇 가지 개념을 함께 알아두면 도움이 됩니다.

  • 토큰: LLM이 텍스트를 처리하는 최소 단위로, 컨텍스트 길이와 API 비용을 계산하는 기준이 됩니다.
  • 프롬프트 엔지니어링: 모델의 가중치를 바꾸지 않고 입력 문장을 다듬어 원하는 답을 끌어내는 작업입니다.
  • 파인튜닝: 사전학습된 LLM을 특정 도메인 데이터로 추가 학습시켜 성능을 맞추는 기법입니다.

이런 기법을 실전에서 어떻게 적용하는지는 프롬프트 엔지니어링 하는 법 글에서 더 자세히 다룹니다.

자주 묻는 질문

  • Q. LLM과 ChatGPT는 같은 말인가요?
    • A. 다릅니다. LLM은 다음 토큰을 예측하는 모델 자체이고, ChatGPT·Claude·Gemini는 그 LLM을 기반으로 만든 대화형 서비스입니다.
  • Q. LLM은 왜 틀린 답을 지어내나요?
    • A. LLM은 사실을 조회하는 것이 아니라 다음 토큰의 확률을 예측해 문장을 만들기 때문에, 근거 없이 그럴듯한 내용을 만드는 환각이 생깁니다. 이를 줄이려면 RAG 같은 기법을 함께 씁니다.
  • Q. 파인튜닝과 프롬프트 엔지니어링은 무엇이 다른가요?
    • A. 파인튜닝은 모델을 추가 학습시켜 가중치를 바꾸는 방식이고, 프롬프트 엔지니어링은 가중치를 바꾸지 않고 입력 문장을 다듬어 원하는 답을 끌어내는 방식입니다.

정리

LLM은 대규모 텍스트 학습을 통해 다음 토큰을 예측하는 능력을 갖춘 모델이며, 이 능력이 요약·번역·대화 같은 다양한 언어 작업으로 이어집니다. 다만 최신 정보 부재나 환각 같은 한계가 있으므로, 용도에 따라 RAG나 프롬프트 설계 같은 보완 기법을 함께 쓰는 것이 좋습니다. LLM의 답변 신뢰도를 높이는 구체적인 방법은 AI 환각 줄이는 법에서 이어서 다룹니다.

관련 글

용어

제로샷 러닝

모델이 특정 작업에 대한 예시 없이, 지시문만으로 바로 그 작업을 수행하는 방식이다. 모델이 학습 과정에서 습득한 일반화 능력에 의존해 새로운 작업에도 곧바로 대응한다.

용어

어텐션

문장 속 각 토큰을 이해할 때 다른 토큰들 중 무엇에 얼마나 '주목'할지를 가중치로 계산하는 메커니즘이다. 트랜스포머의 핵심 연산이다.

용어

트랜스포머

어텐션 메커니즘을 중심으로 문장 속 토큰들의 관계를 한 번에 계산하는 신경망 구조다. 오늘날 대부분의 대규모 언어 모델(LLM)의 기반이 되는 아키텍처다.