-
로컬 llm 설치하기카테고리 없음 2026. 2. 20. 17:16
✅ 0️⃣ 결론 먼저
항목평가CPU 7B Q4까지 가능 RAM 64GB 매우 충분 GTX1650 4GB 7B 일부 GPU offload 가능 추천 모델 7B Q4_K_M 최적 👉 이 시스템은 Pi급이 아니라 “중급 로컬 LLM 서버급”이다.
1️⃣ GPU 문제 해결 (가장 중요)
현재:
드라이버: nouveau이 상태면 CUDA 사용 불가 → GPU 가속 못 씀.
반드시 해야 할 것
① nouveau 제거
sudo apt purge xserver-xorg-video-nouveau② NVIDIA 공식 드라이버 설치
sudo apt install nvidia-driver-535③ CUDA 확인
nvidia-smi정상 출력되면 GPU 가속 가능.
2️⃣ 모델 전략
🔹 1단계 (안정권)
- mistral-7b-instruct-v0.2.Q4_K_M.gguf
- 4.3GB
- VRAM 4GB → 일부 레이어 GPU offload 가능
🔹 2단계 (조금 더 공격적)
- Q4_K_S 버전
- Q5_K_M (RAM 충분하므로 가능)
❌ 비추천
- 13B 이상 → GTX1650 4GB로는 병목
3️⃣ llama.cpp GPU 가속 빌드
CUDA 활성화 빌드:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make clean
LLAMA_CUBLAS=1 make -j$(nproc)(또는 최신 cmake 방식 사용 가능)
4️⃣ 이 시스템 최적 실행 명령
🎯 7B Q4_K_M 기준
./llama-server \
-m ~/models/mistral-7b-instruct-v0.2.Q4_K_M.gguf \
--host 0.0.0.0 \
--port 8080 \
-t 6 \
--ctx-size 4096 \
--n-gpu-layers 20 \
--mlock
옵션 설명 (이 시스템 기준)
옵션설정 이유-t 6 6코어 전부 사용 --ctx-size 4096 RAM 64GB라 가능 --n-gpu-layers 20 GTX1650 4GB 한계 --mlock 모델 메모리 고정
5️⃣ 예상 성능
조건속도CPU만 3~6 tok/s GPU 일부 offload 8~15 tok/s 실사용:
- 짧은 답변 2~4초
- 긴 답변 5~10초
충분히 실전 가능.
6️⃣ RAM 64GB 활용 전략
RAM이 매우 크므로:
✔ 컨텍스트 확장 가능
--ctx-size 8192✔ 여러 모델 동시 구동 가능
- SmolLM (빠른 응답용)
- Mistral 7B (정확도용)
7️⃣ 전기요금 계산
Ryzen 3500 + GTX1650 평균 소비전력 약 120W 가정
0.12kW × 24h × 30일 = 86.4kWh한국 평균 130원/kWh 가정:
86.4 × 130 ≈ 11,232원 / 월→ 월 약 1.1만원
8️⃣ 업그레이드 가치 분석
🔺 RTX 4060 Ti 16GB 교체 시
- 13B Q4 원활
- 7B Q8 가능
- 토큰속도 30~50 tok/s
AI 인프라 수혜 종목
- 삼성전자 (HBM)
- SK하이닉스 (HBM)
- 한미반도체 (패키징)
- 리노공업 (테스트 소켓)
9️⃣ 당신 시스템의 포지션
항목평가로컬 챗봇 매우 적합 OpenClaw 서버 충분 웹검색+검증 가능 13B 이상 연구 GPU 교체 필요
🔟 추천 구조 (가장 현실적인 세팅)
Ryzen 5 3500
+ RAM 64GB
+ GTX1650 (CUDA)
+ Mistral 7B Q4
+ llama-server
+ OpenClaw이 조합이면
중소규모 개인 AI 서버 수준이다.