ABOUT ME

-

Today
-
Yesterday
-
Total
-
  • 로컬 llm 설치하기
    카테고리 없음 2026. 2. 20. 17:16

    ✅ 0️⃣ 결론 먼저

    항목평가
    CPU 7B Q4까지 가능
    RAM 64GB 매우 충분
    GTX1650 4GB 7B 일부 GPU offload 가능
    추천 모델 7B Q4_K_M 최적

    👉 이 시스템은 Pi급이 아니라 “중급 로컬 LLM 서버급”이다.


    1️⃣ GPU 문제 해결 (가장 중요)

    현재:

     
     
    드라이버: nouveau
     

    이 상태면 CUDA 사용 불가 → GPU 가속 못 씀.

    반드시 해야 할 것

    ① nouveau 제거

     
     
    sudo apt purge xserver-xorg-video-nouveau
     

    ② NVIDIA 공식 드라이버 설치

     
     
    sudo apt install nvidia-driver-535
     

    ③ CUDA 확인

     
     
    nvidia-smi
     

    정상 출력되면 GPU 가속 가능.


    2️⃣ 모델 전략

    🔹 1단계 (안정권)

    • mistral-7b-instruct-v0.2.Q4_K_M.gguf
    • 4.3GB
    • VRAM 4GB → 일부 레이어 GPU offload 가능

    🔹 2단계 (조금 더 공격적)

    • Q4_K_S 버전
    • Q5_K_M (RAM 충분하므로 가능)

    ❌ 비추천

    • 13B 이상 → GTX1650 4GB로는 병목

    3️⃣ llama.cpp GPU 가속 빌드

    CUDA 활성화 빌드:

     
     
    git clone https://github.com/ggerganov/llama.cpp
    cd llama.cpp

    make clean
    LLAMA_CUBLAS=1 make -j$(nproc)
     

    (또는 최신 cmake 방식 사용 가능)


    4️⃣ 이 시스템 최적 실행 명령

    🎯 7B Q4_K_M 기준

     
     
    ./llama-server \
    -m ~/models/mistral-7b-instruct-v0.2.Q4_K_M.gguf \
    --host 0.0.0.0 \
    --port 8080 \
    -t 6 \
    --ctx-size 4096 \
    --n-gpu-layers 20 \
    --mlock
     

    옵션 설명 (이 시스템 기준)

    옵션설정 이유
    -t 6 6코어 전부 사용
    --ctx-size 4096 RAM 64GB라 가능
    --n-gpu-layers 20 GTX1650 4GB 한계
    --mlock 모델 메모리 고정

    5️⃣ 예상 성능

    조건속도
    CPU만 3~6 tok/s
    GPU 일부 offload 8~15 tok/s

    실사용:

    • 짧은 답변 2~4초
    • 긴 답변 5~10초

    충분히 실전 가능.


    6️⃣ RAM 64GB 활용 전략

    RAM이 매우 크므로:

    ✔ 컨텍스트 확장 가능

     
     
    --ctx-size 8192
     

    ✔ 여러 모델 동시 구동 가능

    • SmolLM (빠른 응답용)
    • Mistral 7B (정확도용)

    7️⃣ 전기요금 계산

    Ryzen 3500 + GTX1650 평균 소비전력 약 120W 가정

     
     
    0.12kW × 24h × 30일 = 86.4kWh
     

    한국 평균 130원/kWh 가정:

     
     
    86.4 × 130 ≈ 11,232원 / 월
     

    → 월 약 1.1만원


    8️⃣ 업그레이드 가치 분석

    🔺 RTX 4060 Ti 16GB 교체 시

    • 13B Q4 원활
    • 7B Q8 가능
    • 토큰속도 30~50 tok/s

    AI 인프라 수혜 종목

    • 삼성전자 (HBM)
    • SK하이닉스 (HBM)
    • 한미반도체 (패키징)
    • 리노공업 (테스트 소켓)

    9️⃣ 당신 시스템의 포지션

    항목평가
    로컬 챗봇 매우 적합
    OpenClaw 서버 충분
    웹검색+검증 가능
    13B 이상 연구 GPU 교체 필요

    🔟 추천 구조 (가장 현실적인 세팅)

     
     
    Ryzen 5 3500
    + RAM 64GB
    + GTX1650 (CUDA)
    + Mistral 7B Q4
    + llama-server
    + OpenClaw
     

    이 조합이면
    중소규모 개인 AI 서버 수준이다.

Designed by Tistory.