NVIDIA는 오픈 소스 개인 AI 라우터 PAIR를 출시하여 가정에 있는 여러 컴퓨터가 로컬 AI를 공동으로 실행할 수 있도록 합니다.

📅 2026-09-04

요약:

NVIDIA는 최근 IFA 2026에서 개인 AI 라우터(PAIR) 베타 버전을 공식 출시했습니다. 이는 무료 오픈 소스 소프트웨어입니다. 전통적인 의미의 네트워크 하드웨어 라우터가 아니라 로컬 AI 추론을 위한 '가상 라우터'입니다. 동일한 LAN에서 호환되는 컴퓨터를 자동으로 검색하고, 여러 장치의 유휴 컴퓨팅 성능을 구성하며, AI 에이전트 및 로컬 대규모 모델 작업에 더 충분한 추론 리소스를 제공할 수 있습니다.

Nvidia는 PAIR가 기기 상태에 동적으로 적응할 수 있다고 말했습니다. 새 컴퓨터가 네트워크에 연결되거나 기존 장치가 나가면 시스템이 자동으로 조정될 수 있습니다. 라우팅 프로세스에서는 노드 준비 상태, 추론 엔진 상태, 모델이 이미 존재하는지 여부, GPU 활용도 등의 요소를 종합적으로 고려한 다음 요청을 처리할 적절한 머신을 선택합니다. 전체 프로세스에는 전통적인 의미의 서버 클러스터 구축이 필요하지 않으며 전용 케이블, 랙 또는 복잡한 클러스터 구성도 필요하지 않습니다.

보안 측면에서 PAIR 클러스터에 참여하는 기기는 먼저 6자리 페어링 코드를 통해 페어링을 완료해야 하며, 참여 기기 간의 연결이 보호되도록 양방향 TLS(mTLS)를 통해 기기 간에 암호화된 통신 채널이 설정됩니다. NVIDIA는 PAIR의 설계 목표 중 하나가 사용자 자신의 네트워크에서 로컬 AI 워크플로우를 유지하는 것이며 프롬프트 단어, 파일 및 AI 에이전트 컨텍스트를 클라우드 추론 서비스로 보낼 필요가 없다고 강조했습니다.

현재 PAIR 베타 버전은 Windows, macOS 및 Linux를 지원합니다. 하드웨어 측면에서 호환성에는 NVIDIA GeForce RTX 20 시리즈 및 최신 모델, Turing 아키텍처 및 최신 아키텍처 기반 NVIDIA RTX PRO 워크스테이션 GPU, NVIDIA DGX Spark 및 Apple M4 또는 최신 칩이 장착된 Mac 장치가 포함됩니다. NVIDIA에서 제공하는 시스템 요구 사항에도 최소 8GB의 메모리가 포함되어 있으며, 20GB 이상의 디스크 공간을 준비하는 것이 좋습니다. 소프트웨어 자체는 실행하기 위해 인터넷 연결이 필요하지 않지만 모델을 다운로드할 때는 여전히 인터넷 연결이 필요합니다.

NVIDIA의 시연에서는 PAIR가 다중 에이전트 워크플로우에 특히 적합하다는 것을 보여줍니다. 예를 들어, 사용자는 헤르메스 에이전트에게 지저분한 메일함을 정리하고 즉시 처리해야 할 이메일, 나중에 처리할 이메일, 직접 건너뛸 수 있는 이메일을 결정하기 위한 "일요일 재설정" 계획을 개발하도록 요청할 수 있습니다. 에이전트는 여러 하위 에이전트 간에 작업을 분할할 수 있으며, PAIR는 모든 작업이 동일한 GPU를 두고 경쟁하는 대신 이러한 하위 에이전트가 생성한 독립적인 추론 요청을 집에 있는 여러 컴퓨터에 배포합니다. 이런 방식으로 여러 작업을 병렬로 수행할 수 있으며, 메인 컴퓨터는 게임, 창작 또는 기타 작업 중에 AI 계산의 일부를 다른 장치로 전송할 수도 있습니다.

NVIDIA가 발표한 5명의 하위 에이전트 데모도 이러한 접근 방식의 효과를 반영합니다. Hermes Desktop과 Ollama를 사용하면 3개의 장치로 구성된 PAIR 클러스터가 작업을 완료하는 데 8분 48초가 걸린 반면 단일 RTX Spark 노트북은 18분이 걸렸습니다. NVIDIA는 이것이 홈 네트워크에 있는 여러 장치의 유휴 컴퓨팅 성능을 활용하면 로컬 멀티 태스킹 AI의 처리량을 크게 향상시킬 수 있음을 보여준다고 믿습니다.

PAIR에 대한 중요한 판단은 가정 사용자가 이미 특정 컴퓨팅 기능을 갖춘 여러 대의 컴퓨터를 소유하고 있지만 이러한 장치는 대부분의 시간 동안 유휴 상태라는 것입니다. Nvidia가 인용한 데이터에 따르면 미국 가구의 절반 이상이 두 대 이상의 컴퓨터를 소유하고 있으므로 하루 중 상당 부분 동안 많은 수의 GPU 및 기타 컴퓨팅 리소스가 완전히 활용되지 않는다는 점을 지적합니다. 게임용 컴퓨터, 노트북 및 기타 고성능 장치가 있는 가족을 위해 PAIR는 원래 독립된 장치를 로컬 AI를 공동으로 제공할 수 있는 컴퓨팅 리소스 풀로 변환하려고 시도합니다.

NVIDIA 기술 팀은 극단적인 경우 가구 내 유휴 컴퓨팅 성능이 약 165TFLOPS에 이를 수 있다고 추정합니다. 담당자는 이러한 로컬 컴퓨팅 파워가 충분히 활용되지 못하고 있는 것을 “가정의 유휴 무료 토큰 자원”으로 설명했습니다. 그러나 NVIDIA는 PAIR에 정말로 적합한 일반 사용자가 그렇게 과장된 장치 크기를 가질 필요가 없을 것으로 기대합니다. 보다 현실적인 구성은 MacBook 또는 Windows 노트북과 게임용 PC일 수 있습니다.

PAIR 외에도 NVIDIA는 로컬 AI 에이전트의 배포 경험을 더욱 단순화하기 위해 이번에도 발표했습니다. Perplexity Portable Computer, Hermes Agent 및 OpenClaw를 포함한 세 가지 AI 에이전트 소프트웨어는 NVIDIA GPU에 대한 보다 간단한 로컬 구성 방법을 제공합니다. 과거에는 사용자가 모델을 선택하고, 호환 가능한 추론 서버를 찾고, 양자화 매개변수를 조정하고, 다양한 구성을 완료해야 하는 경우가 많았습니다. 새로운 솔루션은 이 프로세스를 몇 번의 클릭만으로 압축하기를 희망합니다.

이 중 Perplexity Portable Computer는 이전에 Linux 시스템에서 최소 24GB의 비디오 메모리와 DGX Spark를 탑재한 NVIDIA RTX GPU에서 실행할 수 있었으며 Windows 버전도 진행 중입니다. 이를 통해 사용자는 더 많은 워크플로를 온프레미스에 유지하고 추가 검색이나 더 강력한 추론 기능이 필요할 때 클라우드 모델을 사용하도록 선택할 수 있습니다. 시스템은 콘텐츠를 클라우드에 전달하기 전에 사용자 동의를 얻습니다.

누스리서치가 개발한 헤르메스 에이전트(Hermes Agent)는 범용 AI 에이전트다. Windows 버전의 로컬 구성은 원클릭 모델 배포를 지원합니다. 소프트웨어는 자동으로 NVIDIA GPU를 식별하고, 하드웨어에 따라 적절한 모델과 구성을 선택하고, 통합된 NVIDIA 최적화 llama.cpp를 통해 실행할 수 있습니다. Linux 지원은 추후 출시될 예정입니다. 실행 후 Hermes는 도구를 호출하고, 작업 전반에 걸쳐 컨텍스트를 유지하고, 다양한 세션의 정보를 기억하고, 사용을 통해 재사용 가능한 기술을 축적할 수 있습니다.

OpenClaw는 Windows용으로 단순화된 배포 솔루션도 제공합니다. 엔비디아는 OpenClaw가 개방형 AI 에이전트 생태계에서 중요한 프로젝트가 됐으며, GitHub의 프로젝트 규모가 별 38만 개를 넘어섰다고 밝혔습니다. 새로운 Windows 애플리케이션은 로컬 모델 구성에 대한 임계값을 낮춰 최소 24GB의 비디오 메모리 NVIDIA RTX GPU를 보유한 사용자가 로컬 AI 보조자를 더 쉽게 시작할 수 있도록 해줍니다.

로컬 AI 에이전트의 응답 속도를 더욱 향상시키기 위해 NVIDIA는 llama.cpp와 vLLM에 대한 추론 최적화도 동시에 발표했습니다. 새로운 커널 최적화, 더욱 진보된 추론적 디코딩, 보다 빨라진 사전 채우기 처리를 기반으로 GeForce RTX 5090의 llama.cpp 처리량은 최대 1.9배까지 증가할 수 있습니다. vLLM 성능은 RTX PRO 6000 Blackwell Workstation Edition에서는 최대 1.2배, 두 개의 DGX Spark로 구성된 클러스터에서는 최대 1.4배 향상될 수 있습니다. 이러한 최적화는 해당 추론 백엔드를 통해 이미 사용 가능하며 LM Studio 및 Ollama에서도 사용 가능합니다.

Nvidia는 이번에 RTX Spark 플랫폼을 탑재한 새로운 Windows 소형 AI 컴퓨터가 10월에 출시될 예정이라고 밝혔습니다. 이러한 로컬 AI 지향 하드웨어, 추론 소프트웨어 및 AI 에이전트 도구가 점차 성숙해짐에 따라 NVIDIA는 기존 클라우드 AI를 사용하는 다른 방식을 분명히 장려하고 있습니다. 사용자는 모든 작업을 원격 데이터 센터에 제출할 필요가 없으며 집에서 GPU 및 기타 장치를 직접 사용하여 자체 로컬 AI 컴퓨팅 환경을 구축할 수 있습니다.

PAIR는 아직 베타 단계에 있으며 프로젝트는 오픈 소스로 출시되었습니다. 개발자는 소스 코드를 보고, 문제를 제출하고, 개선 사항에 참여할 수 있습니다. NVIDIA는 PAIR를 통해 로컬 AI가 "모델을 실행하는 단일 고성능 컴퓨터"에서 "AI 워크로드를 공유하는 여러 홈 장치"로 점차 이동하고, 이는 로컬 AI 에이전트의 대중화 이후 새로운 컴퓨팅 모델이 될 수도 있기를 바라고 있습니다.

관련 태그

관련 글

댓글

0/500
Captcha (click to refresh)
댓글 없음