회사는 폐쇄망인데 AI 코딩 쓰고 싶다면 — 모델·GPU·개인 사용까지
회사 보안 정책상 코드가 바깥으로 한 줄도 못 나가는 폐쇄망(온프레미스). 그런데 옆 팀은 클라우드 AI로 날아다닙니다. "우리도 폐쇄망에서 AI 코딩 되나요?" — 됩니다. 다만 외부망과는 규칙이 좀 달라요. 뭘 준비해야 하는지 한 번에 정리했어요.
외부망 vs 폐쇄망 — 근본 차이
| 구분 | 외부망 (클라우드 API) | 폐쇄망 (온프레미스) |
|---|---|---|
| 모델 | 최신 플래그십 (Claude·GPT·Gemini) | 오픈웨이트 모델 자체 호스팅 |
| 데이터 | 외부 서버로 전송 | 사내에만 머묾 |
| 성능 | 최상급 | 한 발 뒤 (격차는 좁혀지는 중) |
| 비용 | 토큰당 종량제 | GPU 초기투자 + 전기·운영 |
| 최신성 | 자동으로 최신 | 직접 받아서 업데이트 |
한 줄로 요약하면 외부망은 "성능·편의", 폐쇄망은 "데이터 통제" 를 삽니다. 어느 쪽이 맞는지는 회사의 보안 요구가 결정해요.
폐쇄망 AI 코딩 도구는 3층 구조예요
'AI 코딩'이라고 다 같은 게 아니에요. 하는 일의 난이도에 따라 크게 3단계로 나뉘고, 위로 갈수록 더 똑똑한(그래서 더 크고 무거운) 모델이 필요해요. 회사로 치면 조수 → 실무자 → 팀장 순이라고 보면 쉬워요.
| 역할 | 하는 일 | 필요 모델 · 폐쇄망 예 |
|---|---|---|
| 어시스턴트 | 인라인 자동완성 | 소형 7–22B — Codestral, Qwen Coder |
| 에이전트 | 여러 파일 수정·실행 | 중대형 32–70B — Qwen3-Coder, DeepSeek |
| 매니저 | 작업 분해·지휘·검수 | 최상급 — 폐쇄망엔 아직 버거움 |
조금 더 풀어볼게요.
① 어시스턴트 = 옆에서 거드는 조수 코드를 한두 글자 치면 나머지 줄을 대신 완성해줘요. "이 다음은 이거죠?" 하고 제안하는 정도라, 결정은 내가 합니다. 툭툭 바로 떠야 하니 작고 빠른 모델이면 충분해요.
② 에이전트 = 시키면 해오는 실무자 "로그인 기능 만들어줘"라고 하면 스스로 여러 파일을 만들고 고치고, 필요하면 직접 실행해서 잘 되는지까지 확인해요. 혼자 판단하며 움직이니 머리 좋은(추론력 있는) 중간에서 큰 모델이 필요해요.
③ 매니저 = 큰 일을 쪼개 지휘하는 팀장 "쇼핑몰 하나 만들어줘" 같은 큰 주문을 받아, 할 일을 단계로 쪼개고 → 실무자(에이전트)에게 나눠주고 → 결과를 검수해요. 가장 복잡한 판단이라 제일 똑똑한 최상급 모델이 있어야 하는데, 바로 여기가 폐쇄망의 약점이에요(오픈 모델이 아직 이 수준까진 한 발 부족).
정리하면, 위로 갈수록 일이 어려워지고 그만큼 더 똑똑한 모델이 필요해요. 조수 정도는 작은 모델로 사내에서도 충분하지만, 팀장급 완성도는 아직 플래그십(외부망)이 앞섭니다.
폐쇄망에서 쓸 만한 오픈 모델
전부 가중치가 공개돼 사내에 직접 올릴 수 있는 것들이에요.
- Qwen3-Coder (Alibaba, Apache-2.0) — 자가호스팅 코딩의 대표주자
- DeepSeek — 추론·코딩이 강한 오픈 MoE, 대신 덩치가 큼
- Kimi K3 — 초대형 오픈 MoE, 프런트엔드 강자(지난 기사에서 다뤘죠). 장비를 많이 먹어요
- Mistral Codestral·Devstral — 자동완성·에이전트용으로 온프레 친화적
- OpenAI gpt-oss — 오픈웨이트로 풀린 모델
성능 감을 잡자면, SWE-bench Verified 기준으로 자가호스팅 오픈 모델이 대략 60–72%, 클라우드 플래그십이 80–95% 구간이에요. 최상급만은 못해도 실무엔 충분한 지점까지 올라왔습니다.
폐쇄망 AI 코딩, GPU는 얼마나 있어야 하나
가장 현실적인 질문이죠. GPU에는 VRAM(그래픽 메모리) 이라는 '그릇'이 있어요. 모델을 통째로 이 그릇에 올려놓고 돌리는데, 모델이 그릇보다 크면 아예 안 뜨거나 굼떠집니다. 그래서 "내 GPU 그릇이 얼마나 크냐"가 핵심이에요. 그 전에 단어 두 개만 짚을게요.
- 모델 크기 '7B·32B' — 파라미터(모델이 학습해 품고 있는 숫자) 개수예요. 클수록 똑똑하지만 그만큼 무거워요.
- 4-bit 양자화 — 그 숫자들을 더 적은 자릿수로 줄여 담는 압축 기술이에요. 원본(16-bit)보다 용량이 약 1/4로 줄어서, 같은 GPU에 더 큰 모델을 올릴 수 있어요(품질은 조금만 손해).
이 4-bit 기준이면 파라미터당 0.5GB에 약간의 여유를 더한 만큼 VRAM이 필요해요. 예를 들어 32B는 20GB 안팎이라 24GB 카드 한 장에 딱 들어가죠. 아래 그래프가 크기별로 그걸 보여줘요.
- 7–14B → 개인 PC로 충분 — 게이밍 그래픽카드나 메모리 넉넉한 맥이면 돌아가요. 자동완성·간단한 작업용이에요.
- 32B → 상급 개인 GPU 한 장 — RTX 4090(24GB, 최상급 게이밍 카드) 한 장이면 4-bit로 딱 맞아요.
- 70B급 → 회사용 GPU 한 장 — A100·H100(데이터센터용 고가 GPU) 한 장, 약 40GB가 필요해요.
- 수천억(초대형) → 서버 한 대 — H100을 8장씩 묶은 서버(수억 원대)가 있어야 해요. 대기업 인프라 영역이죠.
단, 위는 모델만 딱 올렸을 때 예요. 대화가 길어질수록(주고받은 내용을 계속 기억해야 하니) 메모리를 더 먹고, 여러 명이 동시에 쓰면 또 늘어나요. 그래서 그릇을 딱 맞추지 말고 여유 있게 잡는 게 좋아요.
현실 체크 ① — 싼 GPU는 딱 그만큼이에요
솔직해질게요. 가격과 성능은 정직합니다. 싼 카드로는 작은 모델밖에 못 올리고, 작은 모델은 딱 그만큼만 해줘요. "싸게 사서 플래그십처럼" 은 없습니다.
| 예산(대략) | GPU · 모델 | 쓰임 |
|---|---|---|
| 40–70만원 | 12–16GB (3060·4060Ti) · 7–14B | 자동완성·짧은 함수 |
| 100–250만원 | 24GB (4090·중고3090) · 약 32B | 쓸 만한 에이전트 작업 |
| 수백만원~ | 다중 GPU·H100 · 70B+ | 본격 자율 개발 (회사) |
그래서 냉정하게 보면 — 개인이 "플래그십급 완성도"를 원한다면 GPU를 사는 것보다 그냥 API(외부망)를 쓰는 게 더 싸고 낫습니다. 하드웨어 0원에 쓴 만큼만 내니까요. 로컬 GPU는 프라이버시·오프라인·상시 대량 사용·공부가 목적일 때 값을 합니다.
"화면 주면 React로 뽑기"는 폐쇄망에서도 되나
스크린샷·디자인을 코드로 바꾸는 건 비전(이미지 인식) 모델이 필요해요. 외부망은 Claude·GPT의 비전이나 v0 같은 도구로 이미 잘 됩니다. 폐쇄망은 오픈 비전 모델(Qwen-VL 계열)로 가능은 하지만, 텍스트 전용보다 손이 한 단계 더 갑니다(정확도·주변 도구 생태계). 그래서 디자인→코드는 아직 외부망이 유리하고, 폐쇄망은 빠르게 따라오는 중이에요.
현실 체크 ② — 폐쇄망도 "프로젝트 통째로 자동"이 되나
외부망에선 AI가 파일 만들고, 라이브러리 깔고, 도커 띄우고, 테스트까지 알아서 하죠. 폐쇄망도 됩니다. 이걸 하는 건 사실 모델이 아니라 '에이전트 하베스' — 도구를 실제로 실행하는 껍데기예요. 모델은 "무엇을 할지"만 정하고요.
그 하베스가 오픈소스로 나와 있어요 — OpenHands·Cline·Aider·SWE-agent. 사내에 올려 셀프호스팅 모델(vLLM·Ollama)에 연결하면, 코드가 밖으로 안 나가면서 프로젝트 전체 구현이 로컬에서 돌아갑니다. 대신 두 가지를 챙겨야 해요.
| 폐쇄망에서 챙길 것 | 해법 |
|---|---|
| 인터넷이 없어 npm·pip·도커를 외부에서 못 받아요 | 사내 미러(Nexus·Artifactory·Harbor)를 바라보게 설정 (보통 이미 있어요) |
| 오픈 모델은 자율성·완성도가 플래그십보다 한 수 아래 | 긴 자율 작업일수록 사람이 더 자주 개입 |
정리하면 병목은 딱 둘 — 사내 패키지 미러가 있느냐, 모델이 얼마나 똑똑하냐 예요. 장비만 받쳐주면 폐쇄망에서도 "통째로 자동"이 불가능하진 않습니다.
개인이 로컬에서 AI 코딩 돌리려면
됩니다. 7–32B 오픈 모델은 RTX 4090 한 장이나 통합 메모리가 큰 맥(64–128GB)에서 Ollama·LM Studio로 로컬 구동돼요. 자동완성과 중간 규모 작업은 충분합니다. 가장 쉬운 시작점은 Ollama예요.
# 1) 오픈 코딩 모델을 받아서 실행
# (인터넷 없는 폐쇄망이면 사내 미러에 미리 받아둔 걸 씁니다)
# 32B → RTX 4090(24GB) 한 장이면 4-bit로 구동돼요
ollama run qwen2.5-coder:32b
# 2) 로컬 API가 열려요(기본 11434 포트). 에디터 확장(Continue 등)이 여기에 붙습니다
# → 코드가 사내 밖으로 한 줄도 안 나갑니다
curl http://localhost:11434/api/generate -d '{
"model": "qwen2.5-coder:32b",
"prompt": "파이썬으로 CSV 읽어서 합계 내는 함수 짜줘"
}'정리하면 — 자동완성과 중간 작업은 오픈 모델 + GPU 한 장으로 사내에서(또는 개인 PC에서) 충분히 돌아가고, 전체를 지휘하는 최상급 '매니저' 판단은 아직 플래그십이 앞섭니다. 우리 회사는 폐쇄망인가요, 외부망인가요? 어떤 모델을 굴리고 있는지 방에 공유해 주세요 ⚡