요약:
한 개발자가 완료한 실험에 따르면 iPhone 17 Pro Max를 M4 Pro 칩이 탑재된 MacBook Pro에 맞춤형 소프트웨어를 통해 연결하면 로컬 대형 언어 모델의 작동 효율성이 크게 향상될 수 있는 것으로 나타났습니다. Qwen3.8-27B 모델을 실행하면 시스템의 프리필 성능이 최대 44% 향상됩니다.

이 실험의 배경은 대규모 언어 모델의 비디오 메모리 및 시스템 메모리 용량 요구 사항이 매우 높다는 것입니다. M4 Pro 칩이 탑재된 MacBook Pro에는 24GB의 통합 메모리가 있지만 270억 개의 매개변수 수준이 있는 대규모 모델을 실행할 때 여전히 메모리 용량과 컨텍스트 창 크기로 인해 제한됩니다. 따라서 개발자들은 USB-C 인터페이스를 통해 MacBook Pro와 함께 모델을 실행하기 위해 iPhone 17 Pro Max를 추가 컴퓨팅 노드로 사용하려고 했습니다.
개발자가 발표한 계획에 따르면 MacBook Pro는 각 256개의 토큰 배치에서 레이어 1부터 레이어 40까지 컴퓨팅 작업을 처리하고 중간 활성화 데이터를 실시간으로 iPhone으로 전송합니다. 이후 iPhone 17 Pro Max는 A19 Pro 칩의 GPU를 사용하여 레이어 41~64 작업을 계속 수행하는 반면, Mac은 다음 데이터 배치를 동시에 처리하기 시작합니다. 이러한 파이프라인 작업 분할을 통해 두 장치가 동시에 모델 추론 프로세스에 참여할 수 있습니다.
실험 결과, MacBook Pro에서만 모델을 실행했을 때와 비교하면, iPhone 도입 후 사전 충전 속도가 크게 향상된 것으로 나타났습니다. 8K 컨텍스트 창에서 처리 속도는 초당 132개 토큰에서 177개 토큰으로 35% 증가합니다. 16K 컨텍스트 창에서 성능은 초당 109개 토큰에서 157개 토큰으로 44% 증가합니다. 32K 컨텍스트 창 시나리오에서 처리 속도는 초당 101개 토큰에서 130개 토큰으로 약 29% 증가합니다.
GPU 협업 컴퓨팅 외에도 A19 Pro 칩의 신경망 엔진도 일부 작업에 참여합니다. 개발자들은 모든 16K 역사적 컨텍스트가 처리를 위해 전용 신경망 모델로 변환될 것이라고 밝혔습니다. 140,000개의 토큰 컨텍스트 규모에서 단일 토큰의 쓰기 시간은 GPU에만 의존할 때 279밀리초에서 176밀리초로 단축되어 긴 컨텍스트 시나리오에서 운영 효율성이 더욱 향상됩니다.
그러나 이 솔루션에도 제한이 없는 것은 아닙니다. 개발자들은 iPhone이 주로 사전 채우기 단계의 성능을 향상시키는 데 도움이 되는 반면, 64K 이하의 텍스트 생성 작업에서는 실제 추론 작업의 대부분이 여전히 주로 Mac에서 수행된다는 점을 지적했습니다. 또한 이 솔루션에는 특별히 개발된 소프트웨어 지원이 필요하며 현재 일반 사용자가 직접 배포하는 데 적합하지 않습니다.
그럼에도 불구하고 이 실험은 로컬 AI 컴퓨팅을 위한 소비자급 Apple 기기의 잠재력을 보여줍니다. 모바일 칩의 성능이 지속적으로 향상됨에 따라 향후 스마트폰, 태블릿, 개인용 컴퓨터 간에 보다 유연한 협업 컴퓨팅 시스템이 형성될 수 있으며, 이를 통해 대규모 인공 지능 모델을 실행하기 위해 단일 장치 하드웨어 구성에 대한 의존도를 줄일 수 있습니다.
댓글