테마 전환

Ollama + Open WebUI로 로컬 ChatGPT 인터페이스 구축하기(완전 가이드)

Easton editorial illustration: one local-model cube flowing into a large browser chat card

Ollama를 사용하면 로컬에서 대규모 언어 모델을 실행하는 일이 놀랄 만큼 간단해집니다. 명령어 하나로 설치할 수 있고, 8GB 메모리의 오래된 노트북에서도 7B 모델을 실행할 수 있습니다. Open WebUI는 ChatGPT 스타일의 인터페이스를 제공하며 Docker로 한 번에 배포할 수 있고, 지식 베이스와 다중 사용자 관리, OpenAI 호환 API까지 내장되어 있습니다.

이 글에서는 두 도구를 사용해 로컬에 완전한 AI 채팅 시스템을 구축하는 방법을 설명합니다.


로컬 배포를 선택하는 이유

ChatGPT와 Claude는 모두 유용하지만, 몇 가지 아쉬운 점이 있습니다.

비용 문제입니다. 매달 20달러면 1년에 240달러입니다. 자주 사용하는 사람에게는 괜찮을 수 있지만, 가끔 코드 질문을 하거나 자료를 찾는 정도라면 아깝게 느껴집니다. 로컬 모델은 한 번 다운로드하면 무료이고, Token 요금이나 구독 갱신을 신경 쓸 필요도 없습니다.

개인정보 보호도 중요합니다. 입력한 내용은 OpenAI나 Anthropic 서버로 전송됩니다. 업무 문서, 개인 메모, 사적인 대화까지 보낸다고 생각하면 솔직히 마음이 놓이지 않습니다. 로컬에 배포하면 데이터는 모두 내 하드 디스크에만 남고 외부로 나가지 않습니다.

오프라인 사용도 장점입니다. 여행 중이거나 인터넷 연결이 좋지 않으면 클라우드 AI를 사용할 수 없습니다. 로컬 모델은 다운로드한 뒤 완전히 오프라인으로 실행되므로 인터넷이 없어도 쓸 수 있습니다.

사용자 지정도 가능합니다. 클라우드 서비스에서는 Temperature나 Prompt 템플릿 같은 매개변수가 고정되어 있어 마음대로 조정할 수 없습니다. 로컬에서 실행하면 원하는 대로 바꿀 수 있습니다.


핵심 개념 빠르게 살펴보기

뒤에서 헷갈리지 않도록 먼저 두 도구가 무엇인지 알아보겠습니다.

Ollama는 모델 실행기입니다. 대규모 언어 모델의 다운로드, 관리, 실행을 도와주고 API도 제공합니다(기본 포트는 11434). 쉽게 말해 ‘로컬 버전 OpenAI API’라고 생각하면 됩니다.

Open WebUI는 웹 인터페이스입니다. ChatGPT 스타일의 채팅 창, 모델 전환, 기록 관리 기능을 모두 제공합니다. API를 통해 Ollama에 연결해 명령줄 작업을 브라우저의 그래픽 인터페이스로 바꿔 줍니다.

구조는 다음과 같습니다.

브라우저 (localhost:3000)

Open WebUI (Docker 컨테이너)
    ↓ HTTP API
Ollama (로컬 서비스, 포트 11434)

로컬 모델 (~/.ollama에 저장)

브라우저 열기 → Open WebUI가 Ollama API 호출 → Ollama가 모델을 로드해 추론 → 결과 반환. 이게 전부입니다.


시스템 요구 사항과 준비

배포하기 전에 하드웨어 성능이 충분한지 먼저 확인합니다.

최소 요구 사항:

  • 프로세서: Intel i5 또는 비슷한 성능
  • 메모리: 8GB RAM(16GB 이상이면 더 안정적)
  • 저장 공간: 최소 10GB 여유 공간(모델 파일은 상당히 큽니다)
  • 운영체제: Windows 10+, macOS 11+, Linux

권장 사양:

  • GPU: NVIDIA RTX 3060 이상(추론 속도가 훨씬 빨라집니다)
  • Apple Silicon Mac: M1/M2/M3 시리즈는 통합 메모리 구조라 모델 실행에 적합합니다

소프트웨어 의존성:

  • Docker: Open WebUI 실행에 사용합니다(Docker 없이도 가능하지만 Docker가 편합니다)

Docker가 설치되어 있는지 확인합니다.

docker --version
docker compose version

버전 번호가 출력되면 설치된 것입니다. 출력되지 않는다면 Docker Desktop(Windows/macOS)이나 Docker Engine(Linux)을 먼저 설치합니다.


Step 1: Ollama 설치

Ollama 설치는 명령어 하나면 끝납니다.

1.1 macOS와 Linux에 설치

터미널을 열고 다음 명령어를 실행합니다.

curl -fsSL https://ollama.com/install.sh | sh

스크립트가 Ollama를 자동으로 다운로드해 시스템에 설치합니다. 설치가 끝나면 백그라운드 서비스도 자동으로 시작됩니다.

1.2 Windows에 설치

PowerShell에서 다음 명령어를 실행합니다.

irm https://ollama.com/install.ps1 | iex

또는 ollama.com/download에서 Windows 설치 파일을 다운로드해 더블 클릭으로 실행해도 됩니다.

1.3 Docker로 설치(선택 사항)

Ollama도 컨테이너에서 실행하고 싶다면 Docker를 사용합니다.

docker pull ollama/ollama:latest
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

-v ollama:/root/.ollama는 모델을 Docker 볼륨에 저장합니다. 컨테이너를 재시작해도 모델이 사라지지 않습니다.

1.4 설치 확인

설치가 끝났으면 Ollama가 정상적으로 실행되는지 확인합니다.

ollama --version

ollama version is 0.1.x와 비슷한 버전 번호가 출력되어야 합니다.

서비스가 자동으로 시작되지 않았다면 직접 실행합니다.

ollama serve

이 명령어는 백그라운드에서 Ollama API 서비스를 시작하고 http://localhost:11434에서 요청을 기다립니다.


Step 2: 모델 다운로드 및 실행

Ollama를 설치했으니 이제 모델을 다운로드합니다.

2.1 모델 선택 방법

모델 크기에 따라 필요한 하드웨어가 다릅니다. 아래 표에서 빠르게 선택할 수 있습니다.

하드웨어 사양권장 모델매개변수 수디스크 사용량명령어
8GB RAM, GPU 없음Llama 3.2 1B1B740MBollama run llama3.2:1b
8GB RAM, GPU 없음Gemma 3 2B2B1.4GBollama run gemma3:2b
16GB RAMLlama 3.2 3B3B2GBollama run llama3.2
16GB RAMQwen 2.5 7B7B4GBollama run qwen2.5:7b
16GB RAM + GPULlama 3.1 8B8B4.7GBollama run llama3.1:8b
32GB RAM + GPUDeepSeek R1 14B14B8GBollama run deepseek-r1:14b
64GB RAM + GPULlama 3.3 70B70B39GBollama run llama3.3:70b

용도별 선택:

  • 일상 대화, 간단한 작업: Llama 3.2 1B 또는 3B
  • 중국어 성능 중시: Qwen 2.5 시리즈(Alibaba에서 개발했으며 중국어 성능이 좋습니다)
  • 코드 작성: DeepSeek R1 시리즈(추론 성능이 뛰어나 코드 생성에 적합합니다)
  • 범용 고성능: Llama 3.1 8B 또는 Mistral 7B

2.2 모델 다운로드

ollama pull 명령어로 다운로드합니다.

# Llama 3.2 다운로드(기본 3B 버전)
ollama pull llama3.2

# DeepSeek R1 7B 다운로드
ollama pull deepseek-r1:7b

# Qwen 2.5 7B 다운로드(중국어 성능 우수)
ollama pull qwen2.5:7b

첫 다운로드에는 몇 분이 걸릴 수 있습니다. 모델 크기와 네트워크 속도에 따라 달라집니다. 제가 Llama 3.2를 받을 때는 약 2분이 걸렸고, DeepSeek R1 7B는 조금 더 기다렸습니다.

2.3 모델로 채팅하기

다운로드가 끝나면 바로 실행합니다.

ollama run llama3.2

다음과 같은 채팅 인터페이스가 나타납니다.

>>> Send a message (/? for help)

질문을 입력하면 모델이 실시간으로 답합니다.

>>> 안녕하세요. 자기소개를 해 주세요.

안녕하세요! 저는 Llama 3.2 모델을 기반으로 하는 로컬 AI 어시스턴트입니다...

종료하려면 Ctrl + d를 누르거나 /bye를 입력합니다.

2.4 자주 쓰는 관리 명령어

다운로드한 모델을 확인합니다.

ollama list

특정 모델을 삭제합니다.

ollama rm llama3.2:1b

모델을 복사해 별칭을 붙입니다.

ollama cp llama3.2 my-llama

모델 상세 정보를 확인합니다.

ollama show llama3.2

Step 3: Open WebUI 설치

명령줄만으로도 충분하지만 ChatGPT 스타일의 그래픽 인터페이스를 사용하고 싶다면 Open WebUI를 설치합니다.

3.1 Docker 단일 컨테이너 배포(매우 빠름)

먼저 Ollama 서비스가 실행 중인지 확인한 뒤(ollama serve) 다음 명령어를 실행합니다.

docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  --restart unless-stopped \
  ghcr.io/open-webui/open-webui:main

각 매개변수의 의미는 다음과 같습니다.

  • -p 3000:8080: 컨테이너의 8080 포트를 로컬의 3000 포트에 매핑합니다
  • --add-host=host.docker.internal:host-gateway: 컨테이너가 호스트의 Ollama 서비스에 접근할 수 있게 합니다
  • -v open-webui:/app/backend/data: 데이터(채팅 기록, 사용자 계정)를 영구 저장합니다
  • --restart unless-stopped: Docker를 재시작하면 컨테이너도 자동으로 시작됩니다

배포가 끝나면 브라우저에서 다음 주소로 접속합니다.

http://localhost:3000

3.2 Docker Compose 배포(권장)

Ollama와 Open WebUI를 모두 Docker로 관리하려면 Docker Compose가 더 편리합니다.

먼저 디렉터리를 만듭니다.

mkdir open-webui-project
cd open-webui-project

compose.yaml 파일을 만듭니다.

services:
  open-webui:
    image: ghcr.io/open-webui/open-webui:main
    container_name: open-webui
    ports:
      - "3000:8080"
    volumes:
      - ./data:/app/backend/data
    environment:
      - "OLLAMA_BASE_URL=http://ollama:11434"
    restart: unless-stopped
    depends_on:
      - ollama

  ollama:
    image: ollama/ollama:latest
    container_name: ollama
    volumes:
      - ./ollama:/root/.ollama
    ports:
      - "11434:11434"
    restart: unless-stopped

서비스를 시작합니다.

docker compose up -d

상태를 확인합니다.

docker compose ps

두 컨테이너가 모두 running으로 표시되면 성공입니다.

3.3 최초 접속 및 설정

브라우저에서 http://localhost:3000에 접속하면 처음에는 계정 생성 페이지가 나타납니다.

관리자 계정 생성:

  • 사용자 이름, 이메일, 비밀번호를 입력합니다
  • ‘Sign Up’을 클릭합니다

로그인하면 Open WebUI가 Ollama 서비스를 자동으로 감지해 사용 가능한 모델을 보여 줍니다. 이미 모델을 다운로드했다면 드롭다운 메뉴에 다음과 같이 표시됩니다.

llama3.2:latest
deepseek-r1:7b
qwen2.5:7b

자동으로 감지하지 못했다면 Settings → Connections로 이동해 Ollama API 주소를 직접 입력합니다.

http://host.docker.internal:11434

Docker Compose를 사용한다면 다음 주소를 입력합니다.

http://ollama:11434

Step 4: 기본 사용법

인터페이스가 준비되었으니 사용법을 알아보겠습니다.

4.1 ChatGPT 스타일 채팅

인터페이스는 ChatGPT와 매우 비슷합니다.

  • 왼쪽에는 새로 만들고 삭제하거나 이름을 바꿀 수 있는 채팅 목록이 있습니다
  • 위쪽에는 모델 선택 드롭다운 메뉴가 있습니다
  • 아래쪽에는 입력창이 있으며 내용을 입력한 뒤 Enter를 누르면 전송됩니다

모델(예: llama3.2)을 선택하고 질문을 입력하면 답변이 실시간으로 표시됩니다. ChatGPT와 같은 스트리밍 출력 방식입니다.

4.2 모델 전환

같은 채팅 안에서도 모델을 바꿀 수 있습니다. 위쪽의 모델 드롭다운 메뉴를 클릭하고 다른 모델을 선택한 뒤 대화를 계속합니다.

이 기능은 여러 모델의 답변을 비교할 때 유용합니다. 예를 들면 다음과 같습니다.

  • 같은 질문에 먼저 Llama 3.2가 답하게 합니다
  • DeepSeek R1으로 바꿔 더 깊이 있는 답을 하는지 확인합니다

4.3 채팅 관리

  • 새 채팅: 왼쪽의 ‘New Chat’을 클릭합니다
  • 채팅 이름 바꾸기: 채팅 제목을 클릭하고 바로 수정합니다
  • 채팅 삭제: 채팅을 마우스 오른쪽 버튼으로 클릭하고 삭제를 선택합니다
  • 채팅 기록 검색: 왼쪽 위의 검색창을 사용합니다

모든 채팅은 로컬 Docker 볼륨에 저장되며 클라우드로 업로드되지 않습니다.

4.4 매개변수 조정

입력창 오른쪽의 설정 아이콘을 클릭하면 모델 매개변수를 조정할 수 있습니다.

  • Temperature(온도): 출력의 무작위성을 조절합니다. 낮은 값(0.10.3)은 더 안정적이고 높은 값(0.70.9)은 더 창의적입니다
  • Top P: 어휘 선택 범위를 조절합니다
  • 최대 출력 길이: 답변의 글자 수를 제한합니다

이 매개변수는 결과에 큰 영향을 줍니다. 코드를 작성할 때는 낮은 Temperature를, 창의적인 문구를 작성할 때는 높은 값을 사용합니다.


Step 5: 고급 기능

Open WebUI에는 기본 채팅 외에도 유용한 고급 기능이 몇 가지 있습니다.

5.1 RAG 지식 베이스 구축

RAG(Retrieval-Augmented Generation)는 문서를 AI가 검색할 수 있는 지식 베이스로 바꾸는 기술입니다.

사용 방법:

  1. 왼쪽의 ‘Documents’ 탭을 클릭합니다
  2. ‘Upload’를 클릭하고 파일을 선택합니다(PDF, Markdown, TXT, DOCX 지원)
  3. 파일을 업로드하면 시스템이 자동으로 처리하고 인덱스를 만듭니다

업로드가 끝난 뒤 채팅할 때 ‘Use Documents’를 선택하면 AI가 문서에서 관련 정보를 검색합니다.

활용 예시:

  • 회사 API 문서를 업로드하고 ‘특정 API의 매개변수는 무엇인가요?‘라고 질문합니다
  • 개인 메모를 업로드하고 ‘지난 회의의 결론은 무엇이었나요?‘라고 질문합니다
  • 기술 PDF를 업로드하고 ‘특정 개념을 자세히 설명해 주세요’라고 질문합니다

바로 로컬 버전의 ‘지식 베이스 채팅’입니다. 문서는 모두 내 하드 디스크에 보관됩니다.

5.2 다중 사용자 관리

여러 사람이 시스템을 함께 사용한다면 각각 다른 계정을 만들 수 있습니다.

관리자는 Settings → Users에서 다음 작업을 할 수 있습니다.

  • 새 사용자 생성
  • 사용자 권한 설정(일반 사용자, 관리자)
  • 사용자 목록 확인

각 사용자의 채팅 기록은 독립적으로 저장되며 서로 영향을 주지 않습니다.

5.3 API 연동

Open WebUI와 Ollama는 모두 OpenAI 호환 API를 제공하므로 기존 도구와 바로 연동할 수 있습니다.

Ollama API 호출:

curl http://localhost:11434/api/chat -d '{
  "model": "llama3.2",
  "messages": [
    {"role": "user", "content": "Hello"}
  ],
  "stream": false
}'

Open WebUI API 호출(인증이 필요하다면 먼저 Token을 발급받습니다):

curl http://localhost:3000/api/chat/completions \
  -H "Authorization: Bearer YOUR_TOKEN" \
  -d '{
    "model": "llama3.2",
    "messages": [{"role": "user", "content": "Hello"}]
  }'

Python 예제:

import requests

response = requests.post('http://localhost:11434/api/chat', json={
    'model': 'llama3.2',
    'messages': [{'role': 'user', 'content': 'Hello'}],
    'stream': False
})

print(response.json()['message']['content'])

이렇게 하면 로컬 모델을 VS Code 확장 프로그램이나 자동화 스크립트 또는 OpenAI API를 지원하는 다른 도구에 연결할 수 있습니다.


Step 6: 성능 조정

추론 속도가 느리거나 메모리가 부족하다면 몇 가지 매개변수를 조정해 봅니다.

6.1 GPU 가속

Ollama는 GPU를 자동으로 감지해 사용합니다. GPU를 인식하지 못하면 드라이버가 올바르게 설치되었는지 확인합니다.

NVIDIA GPU:

NVIDIA 드라이버와 CUDA가 설치되어 있어야 합니다. Ollama는 자동으로 nvidia-smi를 호출해 GPU를 감지합니다.

Apple Silicon Mac:

M1/M2/M3 Mac은 추가 설정이 필요 없습니다. Ollama가 자동으로 Metal 가속을 사용합니다.

AMD GPU:

Linux에서는 ROCm 버전 Ollama를 설치할 수 있습니다.

curl -L https://ollama.com/download/ollama-linux-amd64-rocm.tgz -o ollama-linux-amd64-rocm.tgz
sudo tar -C /usr/ -xzf ollama-linux-amd64-rocm.tgz

6.2 동시 실행 설정

여러 모델을 동시에 실행하거나 동시 처리 성능을 높이고 싶다면 환경 변수를 설정합니다.

# 동시에 실행할 모델 수 설정
OLLAMA_NUM_PARALLEL=2 ollama serve

# 최대로 로드할 모델 수 설정
OLLAMA_MAX_LOADED_MODELS=2 ollama serve

이 매개변수는 여러 사용자가 쓰는 환경에서 모델을 자주 전환할 때 발생하는 로드 지연을 줄이는 데 적합합니다.

6.3 모델 양자화

70B 같은 대형 모델이 메모리를 너무 많이 차지한다면 양자화 버전을 사용해 사용량을 줄입니다.

# 4-bit 양자화 버전 다운로드(사용량 약 75% 감소)
ollama pull llama3.3:70b-q4_K_M

양자화하면 품질이 약간 낮아지지만 속도와 메모리 사용량은 크게 개선됩니다.


자주 발생하는 문제 해결

배포 과정에서 문제가 생길 수 있습니다. 가장 흔한 몇 가지를 살펴보겠습니다.

Q1: 모델 다운로드가 매우 느림

원인: Ollama 공식 서버가 해외에 있어 중국에서는 다운로드가 느릴 수 있습니다.

해결 방법:

  • 프록시를 사용합니다
  • 또는 미러 사이트에서 GGUF 파일을 다운로드해 Ollama로 직접 가져옵니다

직접 가져오는 방법은 다음과 같습니다.

# GGUF 파일을 다운로드한 뒤 Modelfile 생성
FROM ./llama3.2.gguf

# 모델 생성
ollama create my-llama3.2 -f Modelfile

Q2: Open WebUI가 Ollama에 연결되지 않음

증상: 인터페이스에 ‘Ollama connection failed’가 표시됩니다.

확인 방법:

  1. Ollama 서비스가 실행 중인지 확인합니다.
curl http://localhost:11434

"Ollama is running"이 반환되어야 합니다.

  1. Docker를 사용한다면 네트워크 설정을 확인합니다.
docker exec -it open-webui curl http://host.docker.internal:11434

연결되지 않는다면 OLLAMA_BASE_URL 환경 변수를 직접 설정해야 할 수 있습니다.

Q3: GPU를 인식하지 못함

증상: 추론 속도가 매우 느리고 nvidia-smi에서 GPU가 사용되지 않는 것으로 표시됩니다.

확인 방법:

  1. NVIDIA 드라이버를 확인합니다.
nvidia-smi

GPU 정보가 표시되어야 합니다.

  1. Ollama가 GPU를 인식하는지 확인합니다.
ollama show llama3.2 --system

CPU-only로 표시된다면 GPU를 인식하지 못한 것입니다.

해결 방법:

  • NVIDIA 드라이버를 다시 설치합니다
  • CUDA 버전이 호환되는지 확인합니다
  • Linux에서는 CUDA_VISIBLE_DEVICES를 설정해야 할 수 있습니다

Q4: 메모리 부족 오류

증상: 대형 모델 실행 중 OOM(Out of Memory) 오류가 발생합니다.

해결 방법:

  • 1B나 3B 같은 더 작은 모델로 바꿉니다
  • 양자화 버전(q4_K_M)을 사용합니다
  • swap 공간을 늘립니다(Linux)
  • 메모리를 많이 사용하는 다른 프로그램을 종료합니다

Q5: Docker 컨테이너 시작 실패

증상: docker ps에서 컨테이너 상태가 Exited로 표시됩니다.

확인 방법:

컨테이너 로그를 확인합니다.

docker logs open-webui

일반적인 원인은 다음과 같습니다.

  • 포트 충돌(3000 포트를 다른 프로그램이 사용 중)
  • 볼륨 권한 문제
  • 메모리 부족

해결 방법:

  • 포트를 바꿉니다(예: -p 8080:8080)
  • Docker 볼륨 권한을 확인합니다
  • 컨테이너 메모리 제한을 늘립니다

정리

Ollama + Open WebUI로 로컬에 ChatGPT 인터페이스를 구축하는 핵심 과정은 다음 네 단계입니다.

  1. Ollama 설치(명령어 하나)
  2. 하드웨어에 맞는 모델 다운로드
  3. Open WebUI 배포(Docker로 한 번에 시작)
  4. 채팅 시작

구축을 마치면 다음 기능을 사용할 수 있습니다.

  • 무료 AI 채팅 어시스턴트
  • 개인정보가 완전히 보호되는 데이터 저장
  • 오프라인 사용
  • 사용자 지정 가능한 모델 매개변수
  • 확장 가능한 지식 베이스(RAG)
  • 연동 가능한 API 인터페이스

이 구성은 개인의 일상적인 사용은 물론 소규모 팀의 내부 배포에도 적합합니다. 더 깊이 알아보고 싶다면 다음 주제도 살펴보세요.

  • Modelfile로 모델 동작 사용자 지정
  • 여러 클라우드 모델 연동(로컬 모델과 OpenAI API 동시 사용)
  • Kubernetes를 이용한 프로덕션급 배포


참고 자료

로컬 ChatGPT 인터페이스 구축하기

Ollama와 Open WebUI를 사용해 로컬에 ChatGPT 스타일의 AI 채팅 인터페이스를 배포합니다.

⏱️ Estimated time: 30 min

  1. 1

    Step 1: Ollama 설치

    운영체제에 맞는 설치 방법을 선택합니다.

    • macOS/Linux: curl -fsSL https://ollama.com/install.sh | sh
    • Windows: irm https://ollama.com/install.ps1 | iex
    • Docker: docker pull ollama/ollama:latest

    설치 후 ollama --version을 실행해 확인합니다.
  2. 2

    Step 2: 모델 다운로드

    하드웨어 사양에 맞는 모델을 선택합니다.

    • 8GB RAM: ollama pull llama3.2:1b
    • 16GB RAM: ollama pull llama3.2
    • 16GB RAM + GPU: ollama pull llama3.1:8b
    • 중국어 최적화: ollama pull qwen2.5:7b
  3. 3

    Step 3: Open WebUI 배포

    Docker 단일 컨테이너로 배포합니다.

    docker run -d -p 3000:8080 \
    --add-host=host.docker.internal:host-gateway \
    -v open-webui:/app/backend/data \
    --name open-webui \
    ghcr.io/open-webui/open-webui:main

    또는 Docker Compose로 두 컨테이너를 관리합니다.
  4. 4

    Step 4: 최초 설정

    http://localhost:3000에 접속합니다.

    • 관리자 계정 생성
    • Ollama 서비스 자동 감지
    • 모델을 선택해 채팅 시작
  5. 5

    Step 5: 고급 기능 설정

    선택 기능은 다음과 같습니다.

    • RAG 지식 베이스: PDF/Markdown 문서 업로드
    • API 연동: OpenAI 호환 엔드포인트
    • GPU 가속: 설정 없이 자동 감지

FAQ

로컬 AI 배포에는 어떤 하드웨어 사양이 필요한가요?
최소 사양은 8GB RAM, Intel i5 프로세서, 10GB 저장 공간입니다. 16GB RAM 이상을 권장하며 NVIDIA RTX 3060 또는 Apple Silicon Mac이 있으면 성능이 더 좋습니다. 70B와 같은 대형 모델에는 64GB RAM이 필요합니다.
Ollama는 어떤 모델을 지원하나요?
주요 오픈 소스 모델을 지원합니다.

• Meta Llama 시리즈(1B~70B)
• DeepSeek R1 추론 모델
• Alibaba Qwen 시리즈(중국어 최적화)
• Google Gemma, Mistral 등

ollama list로 다운로드한 모델을 확인하고 ollama pull로 새 모델을 다운로드할 수 있습니다.
Open WebUI가 Ollama에 연결되지 않으면 어떻게 해야 하나요?
먼저 Ollama 서비스가 실행 중인지 확인합니다(curl http://localhost:11434). Docker로 배포했다면 네트워크 설정을 확인하고 OLLAMA_BASE_URL 환경 변수를 http://host.docker.internal:11434로 직접 설정해야 할 수 있습니다.
로컬에 배포한 AI를 오프라인에서도 사용할 수 있나요?
가능합니다. 모델을 다운로드한 뒤에는 네트워크 연결 없이 완전히 오프라인으로 실행됩니다. 채팅 기록과 지식 베이스 문서도 모두 로컬에 저장되므로 출장이나 여행, 네트워크가 불안정한 환경에 적합합니다.
VS Code 확장 프로그램 같은 기존 도구와 어떻게 연동하나요?
Ollama는 11434 포트에서 OpenAI 호환 API를 제공합니다.

• 엔드포인트: http://localhost:11434/api/chat
• OpenAI API와 동일한 형식
• Python/Node.js에서 직접 호출

API 주소만 OpenAI에서 로컬 주소로 바꾸면 됩니다.

3분 읽기 · 게시일: 2026년 4월 4일 · 수정일: 2026년 9월 4일

댓글

GitHub로 로그인하여 댓글을 남기세요

Easton BlogEaston Blog