Chapter 1. AI Model
생성형 AI의 정의
생성형 AI란?
생성형 AI(Generative AI)란 텍스트, 이미지, 음악, 코드 등의 새로운 콘텐츠를 스스로 생성할 수 있는 인공지능 기술입니다. 기존의 AI가 데이터를 분석하고 분류하는 역할을 했다면, 생성형 AI는 새로운 데이터를 만들어내는 능력을 갖춘 것이 특징입니다. 생성형 AI는 확률적 모델링을 통해 학습 데이터의 분포를 모사하여 콘텐츠를 생성하며, 따라서 동일 입력에도 매번 다른 출력을 생성할 수 있습니다. (비결정적 특성)
생성형 AI 영역 예시
텍스트 생성
- 자연어 이해 및 생성, 문서 작성, 번역, 대화형 AI로 사람처럼 문장을 만들어 대화하거나 글을 씀
- 예시 모델: ChatGPT, Claude, Gemini
이미지 생성
- 텍스트 입력을 바탕으로 고해상도 이미지 생성
- 예시 모델: DALL·E, Midjourney
음악 생성
- 텍스트 입력을 기반으로 음악 작곡 및 편집
- 예시 모델: Suno AI, AIVA
영상 생성
- 텍스트, 이미지, 기존 영상 등의 입력 기반으로 영상 생성
- 예시 모델(서비스): Sora, Runway Gen, Pika Labs, Google Veo
코드 생성
- 코드 자동 생성, 리팩토링, 디버깅 등 개발 업무 효율화
- 예시 모델(서비스): Cursor, Claude Code, GitHub Copilot
기존 AI와의 차이점
기존 AI와 생성형 AI는 근본적인 기능과 활용 방식에서 차이가 있습니다. 기존 AI는 데이터를 분석하고 패턴을 찾아내는 데 초점을 맞추지만, 생성형 AI는 학습한 패턴을 기반으로 새로운 콘텐츠를 생성하는 데 특화되어 있습니다.
| 구분 | 기존 AI | 생성형 AI |
|---|---|---|
| 주요 기능 | 데이터 분석, 예측, 분류, 탐색 | 새로운 콘텐츠 생성 |
| 작동 원리 | 주어진 데이터를 바탕으로 특정 규칙을 학습하여 결과 도출 | 학습한 데이터의 패턴을 활용해 새로운 데이터를 생성 |
| 학습 방식 | 지도 학습 / 비지도 학습 / 강화 학습 | 다양한 학습 방식을 조합 (지도 학습 + 비지도 학습 + 강화 학습 + 생성적 학습) |
| 출력 결과 | 기존 데이터의 패턴을 분석해 답변 (예측, 분류, 추천) | 기존 데이터의 패턴을 기반으로 새로운 데이터 생성 |
| 활용 예시 | 스팸 필터, 추천 시스템, 음성 인식, 사기 탐지 | 텍스트 생성, 이미지 생성, 음악 생성 |
| 한계점 | 새로운 데이터 생성 불가능, 정형화된 작업 수행 | 생성된 데이터의 정확성 검증 필요, 가짜 정보 생성 가능 |
쉽게 말하면?
- 기존 AI는 고양이 사진을 입력하면 "고양이"라고 판별하지만,
- 생성형 AI는 "고양이 사진을 만들어줘"라고 요청하면 고양이 이미지를 만들어 응답할 수 있습니다.
이렇게 생성형 AI는 기존 AI보다 창의적이고 새로운 방식으로 문제를 해결하는 능력을 가졌기 때문에, 업무 자동화, 콘텐츠 제작, 고객 응대 등 다양한 분야에서 혁신을 일으키고 있습니다.
생성 모델 (Generative Model)
생성 모델(Generative Model)이란?
생성 모델은 단순히 데이터를 분류하거나 예측하는 것이 아니라 새로운 데이터를 만들어내는 모델입니다.
생성모델의 종류
생성모델은 다양한 방식으로 데이터를 생성하며, 각 모델은 서로 다른 원리를 기반으로 동작합니다. 대표적인 생성모델의 종류와 특징을 살펴보겠습니다.
생성 모델은 핵심 아키텍처와 생성 방법론의 조합으로 구성됩니다. 아키텍처로는 Transformer가 대표적이며, 생성 방법론으로는 Diffusion과 GAN이 가장 널리 사용됩니다. 최근에는 이들이 결합되기도 합니다. (예: Diffusion Transformer(DiT) --- Stable Diffusion 3, Sora 등에 사용)
이 외에도 Variational Autoencoder(VAE), Autoregressive Model, Flow-based Model과 같은 생성 모델이 존재하며, 특정 연구 및 응용 분야에서 활용됩니다.
| 모델명 | 설명 | 동작 방식 | 예제 |
|---|---|---|---|
| Transformer 기반 모델 (GPT, DALL·E 등) | 문맥을 이해하고, 새로운 텍스트나 이미지를 생성하는 모델 | 입력된 데이터를 여러 단계로 분석하며, 문맥을 이해하여 새로운 내용을 생성. 텍스트 생성(GPT-4), 이미지 생성(DALL·E) | ChatGPT (자연스러운 문장 생성), DALL·E (텍스트 기반 이미지 생성) |
| Diffusion 모델 (Stable Diffusion 등) | 이미지를 점진적으로 개선하며 새로운 그림을 생성하는 방식 | 랜덤한 노이즈(흐릿한 이미지)에서 시작해서 점차 선명한 이미지로 발전. GAN보다 자연스럽고 고해상도 이미지 생성 가능 | Stable Diffusion (다양한 스타일의 그림 생성), Imagen (텍스트 기반 고품질 이미지 생성) |
| GAN (Generative Adversarial Network) | 두 개의 신경망이 경쟁하면서 더 정교한 데이터를 생성하는 모델 | 생성자(Generator)와 판별자(Discriminator)가 서로 경쟁하며 적대적 학습을 통해 점점 더 정교한 데이터를 생성 | 딥페이크(DeepFake), AI 아트, 패션 디자인 |
TIP
- Transformer 기반 모델은 텍스트 및 이미지 생성에서 가장 중요한 역할을 하고 있는 모델입니다.
- 최근에는 Diffusion 모델이 GAN을 사실상 대체하였으며, GAN은 특수 용도(실시간 이미지 변환 등)에서만 제한적으로 사용되고 있습니다.
생성형 AI의 활용 사례
생성형 AI는 다양한 산업에서 실질적인 가치를 제공하며 빠르게 발전하고 있습니다. 텍스트를 자동으로 생성하거나, 번역을 돕고, 코드를 작성하는 등 여러 작업을 AI가 지원하고 있는데요, 그렇다면 구체적으로 어떤 작업과 도메인에서 어떻게 활용되고 있을까요?
1) 텍스트 생성 -- 자동으로 글을 작성하는 AI
- 블로그 및 기사 작성: AI가 초안을 작성하면 사용자는 내용을 다듬는 작업만 진행. 뉴스 기사, 마케팅 콘텐츠 등 다양한 콘텐츠 제작 가능
- 광고 문구 자동 생성: 짧고 강렬한 광고 카피를 AI가 추천
- 활용 서비스: ChatGPT, Jasper AI, Copy.ai, Notion AI, Writesonic
2) 코드 작성 -- 개발자 업무 효율화
- 코드 자동 생성: 개발자가 작성 중인 코드의 다음 줄을 AI가 예측하고 자동 완성
- 코드 리뷰 및 버그 수정: AI가 코드의 오류를 분석하고 개선점을 제안
- 활용 서비스: Cursor, Claude Code, GitHub Copilot, Windsurf
3) 질문 답변(Q&A) -- 고객 응대 및 정보 검색 보조
- 고객 상담 및 지원: AI 챗봇이 고객 문의에 실시간으로 답변 제공
- 검색 엔진 강화: 사용자의 질문에 맞춰 최적의 정보를 제공
- 활용 서비스: ChatGPT API, NotebookLM, Claude
4) 번역 -- 다국어 지원 강화
- 실시간 번역 지원: 여러 언어로 텍스트를 번역하여 글로벌 커뮤니케이션 가능
- 문맥을 고려한 자연스러운 번역: 기존 번역기보다 자연스럽고 정확한 번역 제공
- 활용 서비스: Google Translate, DeepL
5) 문서 요약 -- 긴 글을 핵심만 정리
- 보고서 및 논문 요약: 긴 문서를 짧고 핵심적인 내용으로 자동 요약
- 이메일 요약: 받은 편지함을 빠르게 정리하고 주요 내용만 확인
- 활용 서비스: ChatGPT, NotebookLM, Claude
6) 의료 및 법률 -- 전문 분야에서의 AI 활용
- 의료 데이터 분석: 환자의 건강 데이터를 분석하여 진단 및 치료 보조
- 법률 문서 해석: 긴 법률 문서를 분석하고 주요 내용을 정리
- 활용 서비스: Merative, Google Health AI, Harvey AI, Casetext, CoCounsel
생성형 AI의 윤리적 이슈
생성형 AI는 다양한 분야에서 혁신적이 가능성을 열어주지만, 동시에 여러 윤리적/법적 문제를 동반하고 있습니다. AI 기술이 더욱 발전하고 보편화 될수록, 이러한 문제에 대한 해결책 마련이 필수적입니다.
1) 저작권 문제
- 생성형 AI가 학습하는 과정에서 기존의 저작권이 있는 콘텐츠를 활용할 가능성이 있으며, 생성된 결과물의 저작권 문제도 해결되지 않은 주요 이슈
- AI가 생성한 콘텐츠의 저작권 소유권: AI가 만든 그림, 음악, 글의 저작권이 AI 개발자에게 있는지, 사용자에게 있는지, 아니면 공공재인지 논란이 있음
- 저작권 침해 가능성: AI가 특정 작가의 스타일을 모방한 결과물을 만들 경우, 원저작자의 권리를 침해할 가능성이 있음
2) 악용 가능성
- 허위정보 및 가짜 뉴스 생성: AI는 매우 자연스러운 텍스트를 생성할 수 있어 가짜 뉴스나 허위 정보를 만들어내는 데 사용될 가능성이 큼
- 딥페이크 기술: GAN 기반의 딥페이크 기술은 실제와 구분하기 어려운 가짜 영상을 만들어 정치적 선전, 사기 등에 악용될 위험이 있음
- 사이버 범죄 활용: AI를 이용한 피싱 이메일, 악성 코드 생성 등이 증가하고 있으며, 보안 위협 요소로 작용할 수 있음
3) 개인정보 보호
- AI 학습 데이터 내 개인정보 포함 가능성: AI가 학습하는 데이터에 민감한 개인정보가 포함될 경우, 데이터 유출 등의 문제가 발생할 수 있음
- 데이터 보호 규정과의 충돌: GDPR, CCPA 등의 개인정보 보호법과 AI의 학습 방식이 충돌하는 경우가 있으며, 이에 대한 법적 규제가 필요함
- 한국 인공지능 기본법(2026.01.22 시행, 법률 제20676호)과 EU AI Act(2024.08 발효, Regulation 2024/1689, 단계적 시행)가 시행되어 AI 개발 및 활용에 대한 법적 규제가 구체화되고 있음
4) 소유권 문제
- AI 생성물의 법적 소유권 불분명: AI가 만든 콘텐츠의 소유권이 누구에게 있는지에 대한 명확한 법적 기준이 없으며, 이는 향후 법률적으로 해결해야 할 중요한 문제 중 하나임
- 기업과 개인 간의 소유권 논란: 기업이 AI를 개발했더라도, AI가 사용자 입력을 통해 생성한 콘텐츠의 소유권이 누구에게 귀속되는지가 명확하지 않음
LLM과 Foundation Model
LLM(Large Language Model)이란?
LLM(대규모 언어 모델, Large Language Model)은 사람처럼 자연어를 이해하고 생성할 수 있는 인공지능(AI) 모델입니다. 방대한 양의 텍스트 데이터를 학습하여 문장의 구조와 의미를 파악하고, 주어진 입력(Context)에 적합한 단어나 문장을 예측하는 방식으로 동작합니다.
쉽게 말해, LLM은 많은 글을 읽고 패턴을 학습한 AI 작가입니다. 질문에 답하거나, 글을 요약하고, 번역하는 등 다양한 자연어 처리 작업을 수행할 수 있습니다. 대표적인 LLM에는 OpenAI의 GPT, Google의 Gemini, Anthropic의 Claude, Meta의 LlaMA, 중국의 DeepSeek 등이 있습니다.
LLM은 확률적 언어 모델을 기반으로, 주어진 단어 다음에 올 확률이 높은 단어를 예측하여 문장을 만들어 갑니다. 예를 들어, "오늘 날씨가"라는 입력이 주어지면, "좋아요" 또는 "추워요" 같은 단어를 선택할 가능성이 높습니다. 즉, 단순히 단어를 나열하는 것이 아니라, 문맥(Context)을 고려하여 가장 자연스럽고 의미 있는 문장을 생성합니다.
LLM을 깊이 이해하려면, 이를 구성하는 핵심 요소들을 살펴볼 필요가 있습니다. 하지만 그 전에, LLM이 속하는 더 넓은 개념인 Foundation Model을 먼저 알아보겠습니다.
| 특징 | 설명 |
|---|---|
| 대규모 매개변수 | 수십억(Billions) 이상의 파라미터로 복잡한 언어 패턴 학습 |
| 자기 지도 학습(Self-supervised Learning) | 레이블 없는 대량의 텍스트 데이터로 사전 학습 |
| 범용 언어 능력 | 번역, 요약, 질의응답, 코드 생성 등 다양한 작업 수행 가능 |
| In-context Learning | 별도 학습 없이 프롬프트 내 예시만으로 새로운 작업 수행 |
Foundation Model이란?
Foundation Model은 방대한 양의 데이터로 사전 학습(Pretraining)된 범용 AI 모델을 의미합니다. 이 모델은 특정 작업에 국한되지 않고, 다양한 용도로 활용될 수 있도록 설계됩니다. LLM은 이러한 Foundation Model의 한 종류로, 자연어를 이해하고 생성하는 데 특화된 형태입니다.
Foundation Model의 핵심 특징
(1) 범용성 (Generalization)
- 한 가지 작업만 수행하는 것이 아니라, 다양한 자연어 처리(NLP) 작업에 활용될 수 있습니다.
- 예를 들어, OpenAI의 GPT 모델은 단순한 문장 생성뿐만 아니라 요약, 번역, 질의응답 등 여러 작업을 수행할 수 있습니다.
(2) 사전 학습(Pretraining)과 미세 조정(Fine-tuning)
- 사전 학습(Pretraining): 거대한 데이터셋을 기반으로 일반적인 언어 지식과 패턴을 학습되어 있습니다. 따라서 기본적인 언어 능력을 미리 갖춘 상태에서 활용되어 다양한 작업에 쉽게 적용될 수 있습니다.
- 미세 조정(Fine-tuning): 특정 데이터(예: 법률 문서, 의료 논문)로 추가 학습하여, 해당 분야에서 더 정확하고 신뢰도 높은 결과를 생성할 수 있습니다.
(3) 대량 데이터 기반 학습
- 일반적으로 수백억 개의 단어 또는 문장을 학습하여 방대한 언어 지식을 보유합니다.
- 이를 통해 사람과 유사한 수준의 문맥 이해와 자연스러운 문장 생성을 수행할 수 있습니다.
과거의 AI 모델은 특정한 작업을 위해 개별적으로 설계되고 훈련되었습니다. 하지만 Foundation Model의 등장으로 하나의 강력한 모델을 기반으로 다양한 AI 솔루션을 개발할 수 있는 길이 열렸습니다.
Foundation Model과 LLM의 관계
LLM은 자연어를 처리하는 Foundation Model의 대표적인 예시입니다.
Foundation Model에는 LLM뿐만 아니라 이미지 생성 모델(예: Stable Diffusion), 음성 모델(예: Whisper), 코드 생성에 활용되는 코드 특화 모델 등도 포함됩니다. 따라서 모든 LLM은 Foundation Model이지만, 모든 Foundation Model이 LLM은 아닙니다.
이제 LLM의 내부 구조와 작동 방식을 좀 더 깊이 이해하기 위해, LLM을 구성하는 핵심 요소들을 살펴보겠습니다.
LLM의 핵심 요소
LLM은 단순히 단어를 나열하는 것이 아니라, 입력된 텍스트를 토큰 단위로 변환하고(Context), 방대한 매개변수를 활용해 패턴을 학습하며(Parameter), 최근에는 텍스트뿐만 아니라 다양한 형태의 데이터까지 처리할 수 있도록 발전(Multimodal)하고 있습니다. 이제 LLM을 구성하는 네 가지 주요 요소를 하나씩 살펴보겠습니다.
Token (토큰)
토큰이란?
토큰(Token)은 LLM이 텍스트 데이터를 처리할 수 있도록 나누는 최소 단위입니다. 사람은 단어와 문장을 읽고 이해하지만, LLM은 이를 직접 이해하지 못하기 때문에 텍스트를 작은 조각(토큰)으로 분리하여 수치화된 데이터로 변환해야하고 이것을 토큰화라고 합니다.
토큰의 특징
토큰은 반드시 단어 단위가 아니다.
- 단어 하나가 여러 개의 토큰으로 쪼개질 수도 있고, 반대로 여러 단어가 하나의 토큰이 될 수도 있음
- 단어(Word), 서브워드(Subword), 문자(Character) 등 다양한 방식으로 나뉠 수 있음
같은 문장이라도 토큰화 방식에 따라 토큰 개수가 달라진다
- 모델마다 사용하는 토큰화 방식이 다르기 때문에, 같은 문장이라도 생성되는 토큰 수가 다를 수 있음
- 이는 모델 성능, 비용, 처리 속도 등에 영향을 미침
토큰 수가 많을수록 비용과 연산량이 증가한다.
- LLM은 토큰 단위로 계산하므로, 입력과 출력의 토큰 수가 많아지면 연산량이 커지고, 비용도 증가함
이제 토큰을 나누는 다양한 방식과 그 원리를 살펴보겠습니다.
토큰화(Tokenization) 방식
토큰화를 수행하는 방식에는 여러 가지가 있으며, 모델의 학습 방식과 성능에 직접적인 영향을 미칩니다.
| 방식 | 설명 | 장점 | 단점 | 예시 |
|---|---|---|---|---|
| Word-level (단어 기반 토큰화) | 공백이나 문장 부호를 기준으로 단어를 분리하는 방식 | 단어 단위로 의미를 쉽게 파악 가능 | OOV(Out-Of-Vocabulary) 처리가 어려움. 언어별 특성 고려 필요 | "I love AI" → ["I", "love", "AI"] |
| Character-level (문자 기반 토큰화) | 문장을 개별 문자(Character) 단위로 분리하는 방식 | 모든 텍스트를 처리할 수 있어 OOV 문제 없음 | 너무 작은 단위로 나뉘어 문맥 이해에 비효율적 | "AI" → ["A", "I"], "인공지능" → ["인", "공", "지", "능"] |
| Subword-level (서브워드 기반 토큰화) | 가장 일반적으로 사용되는 방식. 자주 사용되는 단어는 그대로 유지하고, 드문 단어는 더 작은 단위로 분할 | 자주 쓰이는 단어는 유지하면서 새로운 단어도 처리 가능 | 토큰화 과정이 복잡하고 계산량이 많음 | "Artificial" → ["Art", "ificial"], "Unhappiness" → ["Un", "happiness"] |
대부분의 최신 LLM은 서브워드 기반 토큰화를 사용하여 효율적인 학습과 추론을 수행합니다.
Context (문맥)
Context란?
Context(문맥)란, 텍스트 내에서 단어나 문장이 사용되는 환경과 그 의미를 결정하는 요소로, 주어진 문장에서 앞뒤 단어들의 관계, 문장의 흐름, 심지어 대화의 맥락까지 포함합니다. LLM은 개별적인 단어(토큰)만 보는 것이 아니라, 주어진 Context를 고려하여 적절한 출력을 생성합니다.
예를 들어, 다음 문장을 생각해보겠습니다.
- "나는 오늘 아침에 ㅇㅇ를 마셨다."
- 가능한 단어: "커피", "차", "우유"
- "나는 오늘 아침에 ㅇㅇ를 탔다."
- 가능한 단어: "지하철", "버스", "자전거"
같은 위치에 들어갈 단어라도 앞뒤 문맥에 따라 적절한 단어가 달라집니다. LLM은 바로 이 문맥을 이해하고 적절한 단어를 예측하는 방식으로 작동합니다. 의미 있는 문장을 생성하고, 질문과 답변의 일관성을 유지하기 위해서 Context가 중요합니다.
Context Window(맥락 창 크기)와 모델 성능
Context Window란?
Context Window는 LLM이 한 번의 요청에서 처리할 수 있는 최대 토큰 개수를 의미합니다. Context Window가 클수록 한 번에 더 많은 텍스트를 LLM에게 입력할 수 있지만, 계산 비용이 증가하는 단점도 있습니다.
Context Window가 성능에 미치는 영향
Context Window가 작은 경우
- 긴 대화나 문서를 처리할 때, 모델이 앞의 내용을 자르거나 무시하게 되어 정보가 누락될 수 있음
- 예를 들어, 긴 문서를 요약하는 경우 토큰 제한이 4K(4,096)이라면, 앞부분만 이해하고 뒷부분은 무시될 수 있음
Context Window가 큰 경우
- 더 많은 정보를 기억할 수 있지만, 계산 비용이 증가하여 응답 속도가 느려질 수 있음
- 더 많은 토큰을 처리하려면 메모리 사용량과 연산량이 급증하므로, 고성능 GPU가 필요함
- 입력이 너무 길면 중간 부분 정보가 약화되는 Lost in the Middle 문제 발생할 수 있음
컨텍스트 윈도우가 커진다는 것은 모델이 더 많은 정보를 한 번에 참조할 수 있음을 의미할 뿐, 모델의 내재적 추론 능력(reasoning capability) 자체가 향상되는 것을 의미하지는 않습니다.
최신 모델들은 더 많은 토큰을 처리할 수 있도록 발전하고 있으며, 이를 통해 더욱 자연스럽고 일관된 문장을 생성할 수 있습니다.
Parameter (매개변수)
Parameter란?
AI 모델은 훈련하면서 많은 문장을 보고 단어 간의 관계와 패턴을 학습합니다. 이때, 배운 내용(패턴과 지식)을 저장하는 숫자 값이 바로 파라미터(Parameter)이며, 모델의 성능을 결정하는 핵심 요소입니다.
예를 들어, AI가 "하늘이 파랗다"와 "바다는 파랗다"라는 문장을 많이 학습하면, "파랗다"는 "하늘"이나 "바다" 같은 단어와 자주 연결된다는 패턴을 배우게 되고, 이런 관계를 수학적으로 저장하는 값이 파라미터입니다.
모델명 옆에 75B, 7B 등으로 적혀있는 것이 파라미터 수입니다. (B는 10억)
LLM은 학습 과정에서 수십억~수조 개의 매개변수(Parameters)를 최적화하여 언어를 학습합니다. 모델별로 매개변수의 수는 다르며, 매개변수의 수가 많을수록 일반적으로 모델의 성능이 향상되지만, 연산량과 메모리 사용량이 증가합니다.
실무에서는 파라미터 수가 곧 비용과 직결됩니다. 대형 모델(수백B 파라미터)은 API 호출 비용이 높고, 온프레미스 배포 시 고사양 GPU가 필요합니다. 따라서 프로젝트 요구사항(정확도, 응답 속도, 비용 예산)에 따라 적절한 모델 크기를 선택하는 것이 중요합니다.
매개변수의 역할
단어 간 연관성 학습
- 매개변수는 단어와 단어 사이의 관계를 학습하여 의미 있는 문장을 생성하는 데 기여합니다.
- 예를 들어, "파란 하늘"과 "푸른 하늘"이 같은 의미임을 학습한 모델은, 문맥에 따라 적절한 단어를 선택할 수 있습니다.
문맥을 고려한 적절한 단어 예측
다양한 언어 및 스타일 이해
- 매개변수가 많을수록 더 많은 데이터에서 학습할 수 있기 때문에, 다양한 언어와 글쓰기 스타일을 이해하고 적용할 수 있습니다.
- 예를 들어, 모델이 소설 스타일, 뉴스 기사, 코드 작성 등 다양한 문체를 구별할 수 있는 이유도 매개변수 학습 덕분입니다.
Multimodal (멀티모달)
기존의 LLM은 주로 텍스트 데이터를 중심으로 처리하는 방식이었지만, 현재의 최신 모델들은 이미지, 음성, 코드 등 다양한 형태의 데이터를 함께 이해하고 생성할 수 있는 멀티모달(Multimodal) 능력을 기본적으로 지원합니다. 이러한 멀티모달 모델은 단순한 자연어 처리 능력을 넘어, 시각 정보와 음성 데이터를 결합하여 보다 풍부한 이해와 다양한 응용을 가능하게 합니다.
멀티모달 AI는 왜 중요할까?
- 인간은 텍스트뿐만 아니라, 시각적 정보, 청각적 정보 등을 종합하여 세상을 이해합니다.
- 기존 LLM은 텍스트만 처리할 수 있었기 때문에 이미지 기반 정보나 음성 데이터는 별도의 AI 모델이 요구되었습니다. → 멀티모달 모델을 통해 AI가 텍스트, 이미지, 음성 등을 동시에 활용하여 더욱 정교한 응답을 생성할 수 있습니다.
VLM (Vision Language Model, 시각-언어 모델)
VLM(Vision Language Model)은 이미지와 텍스트를 함께 이해하고 처리할 수 있는 멀티모달 AI 모델의 한 유형입니다. 이러한 모델은 이미지를 입력받아 내용을 텍스트로 설명하거나(Image Captioning), 이미지에 대한 질문에 답변하는(Visual Question Answering) 등의 작업을 수행할 수 있습니다.
대표적인 모델로는 GPT-4.1, Claude Sonnet 4.6, Gemini 2.5 Pro 등이 있으며, 이들은 텍스트와 이미지 정보를 통합적으로 이해하는 능력을 제공합니다.
SI 실무에서는 다음과 같은 활용이 가능합니다.
- 문서 이미지에서 정보를 추출하는 문서 OCR 및 문서 이해(Document Understanding)
- 설계 도면 및 기술 문서 이미지 분석
- UI 스크린샷을 기반으로 한 코드 생성 또는 테스트 자동화
- 이미지 기반 고객 문의 응답 시스템
VLA (Vision Language Action Model, 시각-언어-행동 모델)
VLA(Vision Language Action Model)은 시각 정보(Vision)와 언어(Language)를 이해한 뒤 실제 행동(Action)을 생성하도록 설계된 모델 아키텍처입니다. 이는 VLM이 이미지와 텍스트를 이해하는 수준을 넘어, 환경을 인식하고 그에 대응하는 행동을 출력하도록 확장된 형태로 주로 로봇 제어 연구 분야에서 활용됩니다.
최근에는 이러한 개념이 물리적 로봇뿐 아니라 다음과 같은 소프트웨어 에이전트 영역에도 확장되고 있습니다.
- 웹 브라우저 조작 자동화
- GUI 기반 업무 자동화
- 컴퓨터 사용 에이전트(Computer Use Agent)
멀티모달 사례
1) 텍스트 + 이미지 이해
- 모델이 텍스트와 이미지를 동시에 분석하고 의미를 해석할 수 있음
- 적용 사례:
- AI가 이미지를 보고 설명을 생성하는 이미지 캡셔닝(Image Captioning)
- 문서를 스캔하고 내용을 이해하는 OCR(광학 문자 인식)
- 사용자가 그림을 보여주면 해당 그림에 대한 설명을 제공
2) 텍스트 + 음성 처리
- AI가 음성을 인식하고 이를 텍스트로 변환하거나, 음성을 직접 이해하고 응답 생성이 가능함
- 적용 사례:
- 음성을 텍스트로 변환하는 음성 인식 AI (예: OpenAI Whisper)
- 텍스트를 자연스러운 음성으로 변환하는 TTS (Text-to-Speech)
- AI가 사람의 음성을 듣고 문맥을 이해하여 자연스럽게 응답하는 음성 비서(Alexa, Siri 등)
3) 텍스트 + 영상(비디오) 분석
- AI가 영상 데이터를 분석하고, 장면을 요약하거나 의미를 해석하는 능력을 갖춤
- 적용 사례:
- 동영상 속 장면을 요약하고 설명 생성 (예: Google Gemini)
- CCTV 영상에서 특정 사건 감지 (예: 교통 사고 탐지)
LLM이 언어를 이해하고 생성하는 방식
대규모 언어 모델(LLM)이 자연스럽게 문장을 생성할 수 있는 이유는 문맥을 이해하는 Transformer라는 구조와 확률 기반 단어 선택(Sampling) 기법 덕분입니다. Transformer는 문장을 효과적으로 분석하여 문맥을 이해하고, Sampling 기법은 확률적으로 단어를 선택해 더욱 자연스럽고 다양한 문장을 생성하도록 합니다.
이제, Transformer가 어떻게 동작하는지 그리고 LLM이 단어를 생성하는 방법(Sampling 기법)에 대해 살펴보겠습니다.
Transformer
Transformer란?
Transformer는 LLM이 문장을 이해하고 생성하는 데 사용하는 핵심 신경망 구조입니다. 기존의 모델들이 문장을 단어 하나하나 순차적으로 처리하는 방식이었다면, Transformer는 한 문장 내의 모든 단어를 동시에 분석하여 문맥을 이해하는 방식을 사용합니다.
이 방식을 통해 Transformer는
- 더 빠르게 텍스트를 처리하고,
- 문맥을 더 정확하게 반영하며,
- 더 길고 복잡한 문장을 자연스럽게 생성할 수 있습니다.
Transformer의 동작 방식
Transformer는 일반적으로 인코더와 디코더로 구성되지만, 모델에 따라 인코더만 사용하거나 디코더만 사용하는 방식도 있습니다.
1) 인코더(Encoder)
- 인코더는 입력된 문장을 토큰 단위로 변환한 후, 각 단어의 의미와 문맥을 분석합니다. (입력 문장을 이해하는 역할)
- 예를 들어, "나는 커피를 마셨다."라는 문장이 주어졌을 때, 인코더는 "나는", "커피를", "마셨다" 각각의 단어가 문장에서 어떤 의미를 가지는가를 학습합니다.
2) 디코더(Decoder) -- 문장을 생성하는 역할
- 디코더는 인코더에서 처리한 정보를 바탕으로 새로운 문장을 생성합니다.
- 예를 들어, 번역 모델에서 "나는 커피를 마셨다."라는 문장을 입력하면, 디코더는 "I drank coffee."라는 문장을 생성할 수 있습니다.
이 과정에서 Transformer는 이전 단어와 문맥 정보를 기반으로 가장 적절한 단어를 선택하여 자연스러운 텍스트를 생성합니다.
Transformer가 왜 중요한가?
1) 빠른 연산 속도
- Transformer는 병렬 처리가 가능하기 때문에, 기존 모델보다 훨씬 빠르게 텍스트를 처리할 수 있습니다.
- 특히 대량의 데이터를 학습해야 하는 LLM에서는 필수적인 구조입니다.
2) 긴 문맥을 더 잘 이해함
- Transformer는 문장 내 모든 단어의 관계를 고려하기 때문에, 기존 방식보다 더 긴 문맥을 유지하고, 의미 있는 문장을 생성할 수 있습니다.
3) 다양한 AI 모델의 기반이 됨
- GPT, Claude, LLaMA 등 거의 모든 최신 AI 모델은 Transformer 구조를 기반으로 동작합니다.
- 즉, Transformer는 현대 자연어 처리(NLP)의 핵심 기술이라고 할 수 있습니다.
Reasoning Model (추론 모델)
Reasoning Model은 **복잡한 문제 해결을 위해 단계적 추론 과정(reasoning)을 수행하도록 최적화된 대형 언어 모델(LLM)**을 의미합니다. 초기의 LLM은 질문을 입력받으면 비교적 짧은 계산 과정으로 바로 답변을 생성하는 경향이 있었지만, 최신 모델들은 문제 해결 과정에서 여러 단계의 내부 추론을 수행한 뒤 최종 답변을 생성하도록 설계되고 있습니다. 이러한 모델은 수학 문제 해결, 코드 생성, 논리적 분석 등 다단계 사고가 필요한 작업에서 높은 성능을 보이는 것이 특징입니다.
대표적인 모델 및 기능 예시:
- OpenAI o3 / o3-pro / o4-mini
- Claude의 Extended Thinking 모드
- Gemini 2.5 Pro의 Thinking 기능
- DeepSeek-R1
핵심 특징
- 문제 해결 과정에서 내부적으로 긴 추론 과정을 수행
- 단일 단계 응답보다 단계적 문제 해결 능력이 향상
- 수학, 알고리즘, 논리 추론, 코드 생성 등의 작업에서 높은 정확도
장점
- 복잡한 다단계 문제 해결 능력 향상
- 코드 생성, 수학 문제 해결, 분석적 작업에서 성능 개선
단점
- 추론 과정이 길어질수록 응답 지연(Latency)이 증가할 수 있음
- 더 많은 연산량과 토큰 사용으로 비용 증가 가능
AI 에이전트와의 관계
Reasoning Model의 발전은 AI 에이전트의 고급 의사결정 능력을 가능하게 한 핵심 기반 기술로 평가됩니다. 예를 들어 다음과 같은 에이전트 패턴은 모델의 추론 능력에 크게 의존합니다.
- Plan-and-Execute 방식의 작업 계획 수립
- 심층 리서치(Deep Research) 에이전트
- 복잡한 멀티스텝 자동화 에이전트
Sampling(샘플링) 기법
Transformer가 문맥을 이해하고 적절한 다음 단어를 예측하면, 이제 어떤 단어를 선택할 것인지 결정하는 과정이 필요합니다. 이 과정에서 Sampling(샘플링) 기법이 사용됩니다.
Sampling(샘플링)이란?
LLM은 문장을 생성할 때, 다음 단어가 될 가능성이 높은 여러 개의 후보를 예측한 후, 그중 하나를 선택합니다. 샘플링 기법을 사용하면 텍스트의 다양성과 창의성을 조절할 수 있습니다.
주요 샘플링 기법
1) Temperature Scaling (다양성 조절)
낮은 Temperature
- 모델이 가능성이 높은 단어를 선택하여 더 일관성 있는 결과 생성
- 사실적이고 정확한 정보를 제공해야 할 때 유용 (ex. 법률 문서 요약, 의료 정보 제공)
높은 Temperature
- 확률이 낮은 단어도 선택될 수 있어 더 다양한 응답 생성 가능
- 창의적인 결과를 원하는 경우 유용함 (ex. 마케팅 광고 카피 작성)
- Temperature 범위는 API마다 다름: OpenAI는 0.0~2.0, Anthropic Claude는 0.0~1.0
Temperature가 낮을수록 단어간 선택 확률 차이가 커져 선택되는 단어가 거의 확정적입니다.
2) Top-k Sampling (상위 k개 중 선택)
- 모델이 예측한 확률이 높은 k개의 단어 중 하나를 무작위로 선택하는 방식
- 예를 들어 top-k를 5로 설정하면:
- "오늘 날씨가"라는 입력이 주어졌을 때,
- 모델이 가장 확률이 높은 5개 단어를 선택하고("좋다", "덥다", "춥다", "흐리다", "비온다"),
- 그중 하나를 랜덤하게 선택함
- k 값이 작으면? → 더 일관된 결과를 생성 (일관성 증가)
- k 값이 크면? → 더 다양한 결과를 생성
- 일반적인 AI 챗봇에서는 40~50을 많이 사용합니다.
3) Top-p Sampling (누적 확률 기반 선택)
- 확률이 높은 단어부터 순서대로 더하면서, 누적 확률이 p%를 초과하면 나머지 단어들은 제거하는 방식
- Top-k보다 더 유연하게 작동하며, 문맥에 맞는 단어를 더 다양하게 선택할 수 있음
- 0.9가 일반적으로 가장 많이 사용됩니다.
샘플링 기법 비교
| 기법 | 설명 | 낮은 값 | 높은 값 |
|---|---|---|---|
| Temperature | 토큰 확률 분포의 무작위성(randomness)을 조절하는 파라미터. 값이 낮을수록 상위 확률 토큰이 선택될 가능성이 높아지고, 값이 높을수록 다양한 토큰이 선택될 가능성 증가 | 일관성 있고 결정론적인 출력 (예: 법률 문서 요약, 기술 문서 작성) | 다양하고 창의적인 출력 (예: 광고 카피, 스토리 생성) |
| Top-k | 확률이 높은 상위 k개의 토큰 후보 중 하나를 무작위로 선택하는 방식 | k가 작을수록 선택 후보가 제한되어 결과가 더 일관적 | k가 클수록 선택 후보가 많아져 결과가 다양해짐 (일반 챗봇에서는 약 40~50 정도 사용) |
| Top-p | 누적 확률이 p에 도달할 때까지의 토큰 집합에서 선택하는 방식. 후보 개수가 동적으로 결정됨 | 좁은 범위의 토큰에서 선택하여 안정적인 출력 | 넓은 범위의 토큰에서 선택하여 다양한 출력 (일반적으로 0.9 수준 사용) |
실무 조정 예시
| 작업 유형 | Temperature | Top-p | 설명 |
|---|---|---|---|
| 코드 생성 / 정형 문서 작성 | 0.0~0.3 | 0.1~0.3 | 정확성과 일관성이 중요한 작업. 결정론적 출력에 가까운 결과를 유도 |
| 일반 업무 대화 / Q&A | 0.4~0.7 | 0.8~0.95 | 자연스럽고 안정적인 응답 생성 |
| 브레인스토밍 / 창작 | 0.7~1.0 | 0.9~1.0 | 다양한 표현과 아이디어 생성을 유도 |
이해를 돕기 위한 대표적인 설정 예시이며, 실제 운영 환경에서는 모델과 서비스 목적에 맞게 조정이 필요합니다.
LLM의 한계를 보완하는 기법
LLM은 강력한 언어 이해·생성 능력을 갖추고 있지만, 할루시네이션, 학습 데이터 이후의 지식 부족, 맥락 관리의 어려움, 도메인 특화 부족 등 본질적인 한계가 존재합니다. 이러한 한계를 보완하기 위해 다양한 기법이 활용되며, 대표적으로 프롬프트 엔지니어링, RAG, 컨텍스트 엔지니어링, 파인튜닝이 있습니다.
프롬프트 엔지니어링(Prompt Engineering)
같은 모델에 질문 하더라도 어떻게 질문(프롬프트)을 작성하느냐에 따라 출력이 크게 달라질 수 있습니다. 프롬프트 엔지니어링은 LLM이 더 정확하고 원하는 방식으로 응답을 생성하도록 입력을 최적화하는 기법입니다.
알아두기
- 프롬프트를 구조화하거나 구체적인 예시를 포함시키면 모델의 응답 품질이 향상됨
- 단순한 질문보다는 맥락과 조건을 명확히 제시하는 것이 효과적
- Few-shot Learning, Chain-of-Thought 등 다양한 프롬프트 기법이 존재
예시
- 일반적인 프롬프트: "커피가 건강에 좋은 이유는?"
- 최적화된 프롬프트: "과학적 연구를 기반으로 커피가 건강에 미치는 긍정적인 영향을 설명하고, 관련된 논문이나 연구 결과를 인용하여 요약해줘."
프롬프트 엔지니어링에 대한 더 자세한 내용은 이후 챕터에서 다룹니다.
RAG (Retrieval-Augmented Generation, 검색 증강 생성)
LLM은 훈련된 데이터만을 기반으로 응답을 생성하기 때문에, 최신 정보나 특정한 도메인 지식을 포함하기 어렵습니다. RAG(Retrieval-Augmented Generation)는 검색(Retrieval)과 생성(Generation)을 결합하여 LLM이 외부 데이터베이스에서 관련 정보를 찾아 활용할 수 있도록 하는 기법입니다.
알아두기
- LLM이 직접 학습하지 않은 외부 정보를 검색하여 답변의 정확성을 향상시킴
- LLM을 재학습하지 않고도 새로운 정보를 추가하여 보다 유연한 응답 생성 가능
RAG에 대한 더 자세한 내용은 이후 챕터에서 다룹니다.
컨텍스트 엔지니어링(Context Engineering)
컨텍스트 엔지니어링은 LLM에 전달되는 컨텍스트(맥락 정보)를 체계적으로 설계·관리하여, 모델이 최적의 응답을 생성할 수 있도록 하는 기법입니다. 프롬프트 엔지니어링이 "어떻게 질문할 것인가"에 초점을 맞춘다면, 컨텍스트 엔지니어링은 "모델에게 어떤 정보를 어떤 구조로 제공할 것인가"까지 포괄하는 더 넓은 개념입니다.
알아두기
- 시스템 프롬프트, 외부 지식, 대화 이력, 도구 결과 등 모델에 입력되는 모든 맥락 정보를 설계 대상으로 삼음
- 제한된 Context Window 내에서 가장 관련성 높은 정보를 선별하고 구조화하여 제공
- MCP(Model Context Protocol)와 같은 표준 프로토콜을 통해 외부 데이터 소스 및 도구와의 연결을 체계화
컨텍스트 엔지니어링에 대한 더 자세한 내용은 이후 챕터에서 다룹니다.
파인튜닝(Fine-Tuning)
파인튜닝은 기본적으로 학습된 LLM을 특정한 도메인이나 목적에 맞게 추가 학습시키는 과정입니다. 이는 특정 분야(예: 의료, 법률, 금융 등)에서 더욱 정교하고 맞춤화된 응답을 얻기 위해 사용됩니다.
알아두기
- 모델이 특정한 데이터셋을 추가로 학습하여 특정한 스타일이나 도메인에 최적화됨
- 기업이나 연구 기관이 자체 데이터를 활용하여 맞춤형 AI를 개발할 때 주로 사용됨
- 작은 데이터로도 모델의 성능을 개선할 수 있는 방법이 존재(LoRA, Adapter 등 경량화 기법)
생성형 AI 모델은 한계가 분명히 존재하며 그 중 대표적인 문제가 할루시네이션입니다. 이를 줄이기 위해 다양한 최적화 기법이 필요하고, 보다 정확한 정보를 얻기 위해 지속적인 개선이 중요합니다.
LLM의 한계
LLM은 자연어를 이해하고 생성하는 강력한 AI 기술이지만, 완벽하지 않으며 몇 가지 한계를 가지고 있습니다. 이러한 한계를 이해하고, 이를 극복하기 위한 방법을 고민하는 것이 LLM을 효과적으로 활용하는 데 중요한 요소입니다.
할루시네이션 (Hallucination)
LLM은 입력된 데이터에 기반해 확률적으로 가장 적절한 단어를 예측하여 문장을 생성합니다. 하지만 때때로 사실이 아닌 정보, 존재하지 않는 개념, 잘못된 내용을 마치 진짜인 것처럼 생성하는 현상이 발생하는데, 이를 할루시네이션(Hallucination)이라고 합니다.
예시:
- 사용자: "세계에서 가장 긴 다리는?"
- LLM: "세계에서 가장 긴 다리는 대한민국의 'X Bridge'이며, 길이는 50km입니다." (실제 존재하지 않는 다리)
이처럼 자신감 있게 틀린 정보를 생성하는 것이 할루시네이션의 핵심 문제입니다.
왜 할루시네이션이 발생할까?
- LLM은 "이해"하는 것이 아니라 "패턴을 예측"하는 모델이기 때문입니다. 모델은 확률적으로 가장 적절한 단어를 예측하는 방식으로 동작하고, 이 과정에서 사실과 다른 정보를 조합하여 "있을 법한" 문장을 생성할 수 있습니다.
- 학습 데이터의 한계: LLM은 기존 데이터에서 학습하기 때문에, 학습 데이터에 없는 정보는 유추해서 생성합니다. 예를 들어, 2024년 이후의 정보를 학습하지 않은 모델은 최신 뉴스를 정확히 반영할 수 없습니다.
할루시네이션을 줄이는 방법
- 할루시네이션을 줄이는 대표적인 방법 중 하나는 RAG(Retrieval-Augmented Generation, 검색 기반 생성) 기법입니다. RAG는 LLM이 응답을 생성할 때, 외부 데이터베이스나 실시간 검색을 참조하여 더 정확한 정보를 제공하는 방식입니다.
- 프롬프트 엔지니어링(Prompt Engineering)과 파인튜닝(Fine-Tuning)도 할루시네이션을 줄이고 최적화하는 기법입니다.
Context Window의 제한
- LLM은 한 번에 기억할 수 있는 정보의 양(Context Window)이 제한적입니다. 즉, 너무 긴 문서나 대화가 주어지면 초반 내용을 잊어버리고 응답을 생성할 수 있습니다.
예시:
- 사용자가 5000자 이상의 글을 입력하고 요약을 요청하면,
- LLM의 Context Window(예: 4096 토큰)를 초과하는 부분은 기억하지 못하고 무시됩니다.
- 결과적으로, 중요한 정보가 빠진 요약이 생성될 가능성이 있습니다.
Context Window의 제한을 극복하는 방법
- 컨텍스트 압축 (Summarization & Chunking): 긴 문서를 요약하거나 분할하여 LLM이 효과적으로 처리할 수 있도록 함
- 더 큰 Context Window를 가진 모델로 교체: 더 큰 모델을 사용하면 컨텍스트 윈도우 제한을 극복할 수 있지만, 토큰 사용량이 많아질수록 비용이 증가하는 문제가 있기 때문에 적절한 모델 선택에 대한 고려가 필요함
데이터 편향 및 필터링
데이터 편향이란?
- LLM은 인간이 만든 데이터를 학습하기 때문에, 특정한 관점이나 편향이 반영될 가능성이 존재합니다.
- 학습 데이터가 영어 위주라면, 비영어권 언어에 대한 이해도가 낮아질 수 있고, 특정 사회적, 정치적 의견이 더 많이 포함된 데이터로 학습되었다면, 모델의 응답도 편향될 수 있습니다.
예시:
- 가장 좋은 프로그래밍 언어가 무엇인가요? → LLM이 학습한 데이터가 특정 언어 중심이라면 실제로는 개발 목적에 따라 최적의 언어가 다름에도 LLM은 "Python이 최고의 언어입니다"와 같은 일방적인 답변을 줄 수 있습니다.
편향을 줄이는 방법
- 데이터 필터링 및 재학습: AI 연구자들은 중립적이고 공정한 데이터를 제공하기 위해 편향된 데이터를 걸러내고 수정하는 과정을 적용
- 다양한 데이터 학습: 다양한 문화와 의견을 포함한 데이터를 학습하면, 특정 관점에 치우치지 않고 균형 잡힌 응답을 생성할 수 있음
- 사용자의 비판적 사고 활용: LLM의 답변이 항상 객관적인 것이 아니므로, 사용자가 AI의 출처를 확인하고 비판적으로 접근하는 태도가 중요함
실시간 정보 부족 -- 최신 정보 반영의 어려움
- 대부분의 LLM은 사전에 학습된 데이터만을 기반으로 작동하는 "정적인" 모델입니다.
실시간 정보를 반영하는 방법
- MCP(Model Context Protocol)와 같은 표준 프로토콜을 통해 AI 모델이 외부 데이터 소스, 도구, 서비스에 직접 연결하여 실시간 정보를 활용
- RAG(Retrieval-Augmented Generation) 적용: 외부 검색 시스템과 연결하여 최신 정보를 검색한 후 답변을 생성
- 인터넷 연결이 가능한 AI 시스템 활용
- 프롬프트에 최신 데이터를 제공하는 방식: 사용자가 최신 정보를 입력한 후, AI에게 그 내용을 바탕으로 답변하도록 유도
LLM 한계 보완 기법 비교
LLM의 한계를 보완하기 위해서는 Prompt Engineering, RAG, Context Engineering, Fine-Tuning 등 다양한 기법을 활용할 수 있습니다. 다만 각 방법은 보완하는 한계, 적용 난이도, 비용이 서로 다르기 때문에 상황에 따라 최적의 선택이 달라집니다.
가장 먼저 시도할 수 있는 방법은 Prompt Engineering입니다. 추가 비용 없이 프롬프트만 조정해도 출력 품질을 빠르게 개선할 수 있기 때문입니다. 그러나 프롬프트만으로 해결되지 않는 문제도 많습니다. 최신 정보나 사내 데이터를 반영해야 하는 경우에는 모델을 재학습하지 않고도 외부 지식을 활용할 수 있는 RAG가 효과적입니다. 또한 모델에 전달되는 맥락 정보를 보다 체계적으로 설계하고 관리해야 한다면 Context Engineering이 필요합니다. 한편, 특정 업무나 도메인에 최적화된 모델이 필요한 경우에는 Fine-Tuning이 요구됩니다. 다만 이 방법은 비용과 유지보수 부담이 크기 때문에 신중하게 선택해야 합니다. 결국 각 기법의 장단점을 이해하고, 문제 유형과 운영 환경에 맞게 적절한 방법을 선택하는 것이 중요합니다.
| 비교 항목 | Prompt Engineering | RAG | Context Engineering | Fine-Tuning |
|---|---|---|---|---|
| 방식 | 모델을 추가 학습 하지 않고, 프롬프트(질문)를 조정하여 원하는 결과를 유도 | 검색 시스템을 활용해 모델이 외부 지식(DB, 문서)을 참고하여 답변 생성 | 시스템 프롬프트, 외부 지식, 대화 이력, 도구 결과 등 모델에 전달되는 전체 맥락을 체계적으로 설계·관리 | 모델의 가중치를 직접 조정하여 특정 데이터에 맞춰 학습 |
| 보완하는 한계 | 모델의 응답 방향과 품질 제어 부족 | 학습 데이터 이후 지식 부족, 할루시네이션 | Context Window 내 정보 관리, 외부 도구·데이터 연결 체계화 | 도메인 특화 부족, 스타일·톤 불일치 |
| 훈련 기간 | N/A | N/A | N/A | 대개 몇분에서 몇시간 |
| 비용 | 없음 | 낮음 (지식DB 구축 비용) | 낮음 (설계·운영 비용) | 중간 |
| 커스터마이징 | 프롬프트 커스터마이징 | 기업 내부 데이터를 이용하여 지식DB 구축/검색 | 맥락 구조 설계, MCP 연동, 토큰 예산 관리 | 모델 가중치 일부 |
| 요구되는 ML 전문성 | 낮음 | 낮음-중간 | 낮음-중간 | 중간 |
한눈에 정리하는 이번 챕터
- 생성형 AI는 기존 AI와 달리 새로운 콘텐츠(텍스트, 이미지 등)를 생성할 수 있다.
- 생성 모델에는 Transformer, Diffusion, GAN이 있으며, 각각 텍스트/이미지 생성에 강점을 가진다.
- Foundation Model은 사전 학습(Pretraining)된 범용 AI 모델을 의미하며 다양한 AI 응용의 기반이 된다.
- LLM은 Foundation Model의 한 종류로 자연어를 이해하고 생성할 수 있는 AI 모델이다.
- LLM의 핵심 요소에는 토큰, Context, Parameter, 멀티모달이 있으며, 각각이 모델의 성능과 이해력에 영향을 미친다.
- VLM은 이미지+텍스트를 동시에 처리하는 모델이며, VLA는 여기에 행동(Action) 생성을 추가하여 로봇 제어 등에 활용된다.
- LLM은 Transformer 구조를 기반으로 작동하며, Sampling 기법(Temperature, Top-k, Top-p)을 활용해 언어를 생성한다.
- Reasoning Model은 답변 전 명시적 추론 과정을 수행하여 복잡한 다단계 문제의 정확도를 향상시킨다.
- LLM의 최적화를 위해 프롬프트 엔지니어링, RAG, 컨텍스트 엔지니어링, 파인튜닝이 사용되며, 이를 통해 원하는 출력을 보다 정밀하게 조정할 수 있다.
- LLM은 강력한 성능을 갖추고 있지만, 할루시네이션, 데이터 편향, 높은 연산 비용, 정확성 한계 등의 문제를 고려해야 한다.