RAG란 무엇인가 — 파이프라인 해부와 도입 체크리스트
RAG는 외부 지식 저장소에서 질문과 관련된 문서를 검색해, 그 내용을 근거로 LLM이 답변을 생성(generation)하게 하는 기법입니다.
RAG는 외부 지식 저장소에서 질문과 관련된 문서를 검색해, 그 내용을 근거로 LLM이 답변을 생성(generation)하게 하는 기법입니다.
LLM(Large Language Model, 대규모 언어 모델)은 방대한 텍스트 데이터로 사전 학습되어 언어를 이해하고 생성하는 딥러닝 모델입니다.
순정 추론 코드를 그대로 프로덕션에 올리면 GPU 메모리가 빨리 차 OOM이 나고 사용률 그래프에 골짜기가 생깁니다(백서 §1장). 같은 카드로 받는 동시 요청 수가 줄고 대기 시간이 늘어납니다.
현재 많은 공공기관의 대국민 서비스와 내부 행정 시스템은 모놀리식 아키텍처로 구축되어 있습니다.
COSTAR 프레임워크는 대형 언어 모델(LLM)의 프롬프트 엔지니어링을 체계화하기 위해 싱가포르 정부 기술청(GovTech Singapore)의 데이터 과학 및 인공지능 부서에서 개발한 구조화된 접근 방식입니다.
vLLM은 2023년 초부터 개발이 시작된 오픈소스 프로젝트입니다.
GEMMA(젬마)는 구글 딥마인드(Google DeepMind)가 개발한 최신의 대규모 AI 언어 모델 시리즈입니다.
AI 가속기라는 표현은 본래 더 포괄적인 개념입니다.
Exaone은 LG AI Research에서 개발한 초거대 멀티모달 언어 모델(large-scale multimodal language model)로, 텍스트뿐만 아니라 이미지 등 다양한 입력을 동시에 이해하고 처리할 수 있는 모델입니다.
AI 가속기라는 개념은, 인공지능 모델, 특히 딥러닝 모델의 학습이나 추론 과정에서 필요한 대규모 수치 연산을 더 빠르고 효율적으로 처리하기 위한 하드웨어 장치를 의미합니다.