요약:
일부 주요 인공지능 기업들은 2028년을 목표로 1,000억 개의 매개변수 대형 언어 모델을 지속적으로 실행할 수 있는 장치를 개발하기 위해 휴대폰 산업을 추진하고 있습니다. 그러나 이 아이디어에는 두 가지 실질적인 과제에 직면해 있습니다. 첫째, 이러한 대형 모델을 실행하려면 많은 양의 메모리가 필요하고, 둘째, 인공지능 데이터 센터가 글로벌 메모리 생산 용량을 놓고 경쟁하고 있어 소비자급 메모리 공급이 부족하고 가격이 지속적으로 상승하고 있습니다.

Qualcomm CEO Amon은 Fireside Alpha와의 인터뷰에서 인공지능 산업의 선두에 있는 일부 기업이 수천억 개의 매개변수 모델을 지속적으로 실행할 수 있는 휴대폰을 탐색하고 있다고 말했습니다. 그는 이들 회사의 구체적인 이름을 공개하지 않았지만 관련 진술에 따르면 모바일 장치에 대한 인공지능 회사의 기대가 변화하고 있음을 알 수 있습니다. 미래에 휴대폰은 더 이상 클라우드 AI 서비스를 가끔 호출하는 단말기가 아니라 로컬에서 대형 모델을 지속적으로 실행하고 작업을 적극적으로 처리할 수 있는 개인용 컴퓨팅 장치가 될 수 있습니다.
그러나 Amon의 발언은 Qualcomm이 공식적으로 발표한 제품 로드맵보다는 업계 고객이 제안한 목표를 설명하는 데 더 가깝습니다. 현재 Qualcomm은 2028년에 이 목표를 달성할 수 있는 완전한 하드웨어 솔루션을 아직 제공하지 않았으며 그때까지 해당 기능을 갖춘 상용 휴대폰을 출시하겠다고 약속하지도 않았습니다.
기술적인 관점에서 볼 때 1,000억 개의 매개변수 모델은 현재 일반적인 온디바이스 AI 모델보다 휴대전화 하드웨어에 대한 요구 사항이 훨씬 더 높습니다. 대규모 언어 모델의 매개변수는 모델이 저장하고 호출해야 하는 많은 수의 값을 결정하며, 이러한 데이터는 일반적으로 프로세서가 추론 중에 빠르게 액세스할 수 있도록 메모리에 저장되어야 합니다.
1,000억 개의 매개변수가 있는 모델을 예로 들어보겠습니다. 4비트 양자화를 사용하는 경우 이론적으로 각 매개변수에는 4비트의 저장 공간만 필요하므로 모델 매개변수 자체에만 약 50GB의 메모리가 필요합니다. 실제 작업에서는 운영 체제, 기타 애플리케이션, 컨텍스트 캐시 및 추론 중 임시 데이터를 위한 공간도 예약해야 합니다. 따라서 50GB는 휴대폰이 해당 모델을 원활하게 실행하는 데 필요한 전체 메모리 용량이 아닙니다.
모델을 2비트로 추가로 양자화하면 각 매개변수에는 2비트만 필요하며 모델 매개변수에 대한 이론적 저장 요구 사항은 약 25GB로 줄어들 수 있습니다. 그러나 이 솔루션을 사용하려면 휴대폰의 메모리 용량이 현재 주류 제품보다 훨씬 높아야 하며, 정밀도가 극도로 낮은 양자화는 특히 복잡한 추론 작업에서 모델의 출력 품질을 크게 손상시킬 수 있습니다.
매개변수의 수가 모델의 전체 기능을 직접적으로 결정하지는 않는다는 점에 유의해야 합니다. 다양한 모델의 훈련 데이터, 아키텍처, 훈련 방법 및 추론 기술은 모두 최종 성능에 영향을 미칩니다. 특정 작업에서는 작고 최적화된 모델이 더 큰 모델보다 뛰어난 성능을 발휘하는 것이 전적으로 가능합니다. 따라서 휴대폰이 당분간 1000억 매개변수 모델을 직접 구동할 수 없다고 해서 대형 모델에 가까운 실제 사용 경험을 제공할 수 없다는 의미는 아니다.
현재 스마트폰의 메모리 구성과 수천억 개의 매개변수 모델이 요구하는 용량 사이에는 여전히 뚜렷한 격차가 있습니다. 과거 일부 안드로이드 플래그십 휴대폰에서는 24GB LPDDR5X 메모리를 제공한 적이 있습니다. 그러나 메모리 공급이 부족하고 가격이 상승하면서 휴대폰 제조업체들은 대용량 메모리 버전의 상업적 가치를 재평가하기 시작했습니다. 일반 소비자의 경우 메모리 용량 증가는 하드웨어 비용 증가를 의미하며, 휴대폰 제조업체는 사용자가 더 큰 로컬 AI 모델을 실행하기 위해 추가 비용을 지불할 의향이 있는지 판단하기 어렵습니다.
이것은 모순을 낳습니다. 인공 지능 회사는 휴대폰이 점점 더 강력한 로컬 컴퓨팅 기능을 갖기를 희망하지만 이 목표를 달성하는 데 필요한 메모리는 점점 더 비싸지고 얻기가 어려워지고 있습니다.
글로벌 메모리 수급이 타이트한 것은 인공지능 데이터센터의 급속한 확장과 밀접한 관련이 있다. 대규모 기술 기업들은 대용량 DRAM, 고대역폭 메모리, 고속 저장 장치가 필요한 AI 서버에 지속적으로 투자하고 있습니다. 메모리 제조사들도 생산 준비 시 수요가 많고 수익성도 높은 인공지능 관련 제품에 점점 더 많은 관심을 기울이고 있다. 따라서 소비자 전자 장비에 필요한 기존 메모리는 공급 압박을 받고 있습니다.
스마트폰에 사용되는 저전력 D램과 AI 가속기에 사용되는 고대역폭 메모리는 제품 구조와 제조 요구사항이 다르지만, 여전히 반도체 업계 전체의 생산능력 할당과 시장 수급 변화에 영향을 받고 있다. AI 인프라의 메모리 수요가 강해질수록 가전제품 제조업체가 가격과 공급 측면에서 이전 상태를 유지하기가 더 어려워집니다.
이러한 압력은 휴대폰 제조 비용에 반영되었습니다. 앞서 시장조사업체 카운터포인트리서치가 발표한 분석에 따르면 2026년 2분기 스마트폰 메모리 가격은 전 분기보다 80% 이상 올랐다. 가격대가 다른 휴대폰 중에서 메모리 가격 상승은 전체 재료비에 큰 영향을 미칩니다.
Counterpoint는 중저가 휴대폰의 BOM 비용이 전년 대비 약 52% 증가했으며, 전체 BOM 비용에서 메모리가 약 40%를 차지했다고 지적했습니다. 고급형 휴대폰도 영향을 받았으며 DRAM은 시스템 수준 칩을 능가하여 일부 플래그십 휴대폰에서 가장 비싼 단일 구성 요소가 되었습니다.
이는 휴대전화 제조업체가 1,000억 개의 매개변수 모델에 대해 50GB 이상의 메모리를 구성할 수 있는지 여부를 고려해야 할 뿐만 아니라 소비자가 이러한 메모리에 대해 기꺼이 비용을 지불할 의향이 있는지에 대한 보다 현실적인 질문에 대답해야 함을 의미합니다.
대형 모델만 실행하려면 휴대폰의 메모리를 현재 일반적인 12GB 또는 16GB에서 64GB 이상으로 늘려야 하며 전체 시스템 비용이 크게 증가할 수 있습니다. 더욱 강력한 프로세서, 고급 패키징 및 열 설계가 결합되어 최종 제품의 가격은 일반 소비자가 수용할 수 있는 범위에서 훨씬 더 멀어질 수 있습니다.
Qualcomm과 Apple은 칩 아키텍처와 패키징 기술 측면에서 이 문제를 완화하려고 노력하고 있습니다. 관련 보고서에 따르면 Apple A20 Pro와 Qualcomm의 차세대 Snapdragon 플래그십 플랫폼은 데이터 액세스 효율성을 향상시키고 프로세서와 메모리 간의 데이터 전송 오버헤드를 줄이기 위해 대형 모델의 작동에 더 도움이 되는 칩 설계와 메모리 구성 방법을 모색하고 있습니다.
그러나 캡슐화 및 데이터 액세스 효율성이 향상된다고 해서 물리적 메모리 요구 사항이 자동으로 사라지는 것은 아닙니다. 프로세서가 메모리를 보다 효율적으로 활용할 수 있더라도 1000억 개의 매개변수 모델 자체는 여전히 많은 매개변수 데이터를 저장해야 합니다. 이러한 규모의 모델을 휴대폰에 실제로 적용하려면 업계에서는 모델 압축, 추론 아키텍처 및 스토리지 액세스 분야에서 더욱 획기적인 발전을 이뤄야 할 수도 있습니다.
한 가지 가능한 해결책은 보다 근본적인 정량화 기술입니다. 매개변수당 사용되는 비트 수를 줄임으로써 모델은 더 작은 메모리 공간에서 실행될 수 있습니다. 그러나 정량화에는 비용이 들지 않습니다. 복잡한 논리적 추론이 필요한 작업의 경우 수치 정확도가 너무 낮으면 모델 성능이 크게 저하될 수 있습니다. 따라서 메모리 사용량과 모델 품질 사이의 균형을 어떻게 맞추느냐가 최종 AI의 중요한 연구 방향이 될 것입니다.
또 다른 솔루션은 MoE 아키텍처인 하이브리드 전문가 모델입니다. 각 추론을 위해 전체 모델을 호출해야 하는 기존의 집약적 아키텍처와 달리 MoE 모델은 전문가 네트워크의 일부를 선택하여 특정 작업을 기반으로 하는 계산에 참여합니다. 적절한 설계를 사용하면 토큰이 처리될 때마다 모델의 작은 매개변수 집합만 활성화하면 됩니다.
전문가 오프로딩 기술이 추가로 채택되면 현재 필요한 전문가는 DRAM에 유지하고, 필요하지 않은 전문가는 일시적으로 플래시 메모리에 저장할 수 있다. 추론 과정에 다른 전문가가 필요한 경우 해당 데이터를 플래시 메모리에서 메모리로 읽어옵니다.
이 접근 방식을 사용하면 모델이 DRAM에 동시에 상주해야 하는 데이터 양을 줄일 수 있지만 스토리지 액세스 및 데이터 전송 오버헤드가 증가합니다. 휴대폰에 사용되는 UFS 플래시 메모리의 액세스 속도와 지연 특성은 DRAM과 크게 다릅니다. 모델이 플래시 메모리에서 매개변수를 자주 읽는 경우 추론 속도가 영향을 받을 수 있습니다.
Apple은 이전에도 기기에 내장된 저장소를 사용하여 대규모 언어 모델을 실행하는 솔루션을 연구했습니다. 이러한 유형의 기술은 DRAM 용량에 대한 의존도를 줄일 것으로 예상되지만 휴대폰에서 충분히 낮은 대기 시간, 높은 처리량 및 허용 가능한 에너지 소비를 달성할 수 있는지 여부는 여전히 추가 검증이 필요합니다.
또한 대형 모델을 계속해서 실행하면 열 방출 및 배터리 수명 문제도 발생할 수 있습니다. 휴대폰은 내부 공간이 제한되어 있어 데스크톱 컴퓨터나 서버와 같은 대규모 냉각 시스템을 탑재할 수 없습니다. 프로세서가 장시간 고강도 AI 추론을 수행하면 칩 온도가 계속 상승하여 주파수 감소 메커니즘이 트리거되어 성능이 저하될 수 있습니다.
이 문제는 24시간 내내 작동해야 하는 에이전트의 경우 특히 심각합니다. 기존의 챗봇은 일반적으로 사용자가 요청한 후에 작업 처리를 시작하지만, 차세대 AI 에이전트는 지속적으로 정보를 모니터링하고 상황을 분석하며 적절한 시간에 사전에 작업을 수행해야 할 수도 있습니다. 휴대폰이 대형 모델을 24시간 내내 실행해야 한다면 메모리를 항상 사용할 수 있어야 할 뿐만 아니라 프로세서의 전력 소비와 배터리 소비도 엄격하게 제어되어야 합니다.
따라서 미래의 휴대전화가 1,000억 개의 매개변수 모델을 성공적으로 로드할 수 있다고 해도 이상적인 속도로 계속 실행될 수 있다는 의미는 아닙니다. 모델이 실제로 메모리에 상주할 수 있는지, 초당 처리할 수 있는 단어 수, 작동 중에 발생하는 열량, 배터리 수명에 얼마나 영향을 미치는지는 모두 실제 사용 가치를 측정하는 중요한 지표입니다.
1,000억 개의 매개변수 모델을 휴대폰에 직접 연결하는 것과 비교하면, 정제되고 최적화된 중형 모델을 실행하는 것이 더 현실적인 솔루션일 수 있습니다.
모델 추출은 일반적으로 대형 모델의 기능을 활용하여 소형 모델을 학습하므로 후자는 매개변수 규모를 크게 줄이면서 특정 작업에서 대형 모델의 성능을 최대한 유지할 수 있습니다. Wccftech는 적절하게 정제된 200억~300억 개의 매개변수 모델이 특정 작업에 대해 1,000억 개의 매개변수 모델의 성능에 접근할 수 있으므로 미래 스마트폰에서 로컬 AI의 주력이 되기에 더 적합하다고 믿습니다.
이 솔루션의 장점은 극도로 큰 메모리 용량에 의존할 필요가 없으며 매우 강력한 추론 기능을 제공할 수 있다는 것입니다. 휴대폰 제조업체의 경우 단순히 얼마나 많은 매개변수를 수용할 수 있는지 추구하기보다는 모델 아키텍처, 정량화, 증류 및 추론 최적화를 통해 제한된 하드웨어 리소스로 더 나은 실제 경험을 달성하는 것이 좋습니다.
물론 모델마다 성능이 크게 다르며, 모든 작업에서 200억~300억 개의 매개변수 모델이 1,000억 개의 매개변수 모델을 대체할 수는 없습니다. 복잡한 추론, 전문 지식, 장기 컨텍스트 처리와 같은 기능은 여전히 특정 모델의 훈련 및 아키텍처 설계에 달려 있습니다. 그러나 제품화 관점에서 보면 합리적인 전력 소비와 비용으로 대부분의 일상 작업을 완료할 수 있는 것이 순수한 매개변수 규모를 추구하는 것보다 더 가치 있을 수 있습니다.
퀄컴 CEO의 발언에는 스마트폰 업계가 새로운 성장 방향을 모색하고 있다는 점도 반영됐다. 기존 하드웨어 업그레이드의 한계 이점이 점차 감소함에 따라 휴대폰 제조업체는 AI 에이전트를 사용하여 장치 사용 방식을 재정의하기를 희망합니다.
미래의 스마트폰은 더 이상 사용자가 애플리케이션을 열고 명령을 입력하기를 기다리는 장치가 아니라 지속적으로 요구 사항을 이해하고 작업을 조정하며 사용자 승인 범위 내에서 다양한 서비스를 호출할 수 있는 개인 비서가 될 수 있습니다. 이러한 시스템에는 보다 강력한 로컬 추론 기능은 물론 보다 효율적인 메모리 관리, 저전력 컴퓨팅 및 보안 메커니즘이 필요합니다.
그러나 업계 목표와 최종 제품 사이에는 여전히 거리가 있습니다. 아몬은 구체적인 협력사명을 밝히지 않았으며, 완전한 하드웨어 로드맵이나 양산 일정도 제공하지 않았다. 2028년은 퀄컴이 확정한 제품 출시일보다는 일부 AI 기업이 이 기능을 달성하기를 희망하는 목표 시점으로 이해하는 것이 더 적합하다.
현재의 기술 여건으로 볼 때 2028년에 휴대폰에서 수천억 개의 매개변수 모델을 실행하는 것이 완전히 불가능하지는 않지만 구현 방법은 "완전한 모델을 모두 휴대폰 메모리에 로드"하는 방식으로 사람들이 상상하는 것과 다를 수 있습니다. 보다 공격적인 양자화, MoE 아키텍처, 전문적인 오프로딩, 전용 메모리 설계 및 모델 추출이 모두 목표 달성의 일부일 수 있습니다.
동시에 글로벌 메모리 공급 및 가격 추세는 이 방향의 상업적 생존 가능성에 직접적인 영향을 미칠 것입니다. AI 데이터센터로 인해 소비자급 DRAM 공급이 오랫동안 압박된다면, 기술적으로 64GB 이상의 메모리를 탑재한 휴대폰을 제조하는 것이 가능하더라도 제조업체에서는 이러한 제품을 대규모로 출시할 의향이 없을 수도 있습니다.
따라서 1000억 매개변수 휴대폰에 대한 Qualcomm의 비전은 칩 성능 측면뿐만 아니라 모델 크기, 메모리 용량, 제조 비용, 열 방출, 배터리 수명 및 소비자 수요 간의 포괄적인 균형을 통해 해결되어야 합니다. 일반 사용자에게 미래에 가장 주목되는 것은 휴대폰이 1000억 개의 매개변수를 가진 모델을 실행할 수 있는지 여부가 아니라, 가격을 크게 높이거나 배터리 수명을 심각하게 희생하지 않고도 안정적이고 빠르며 정말 유용한 로컬 AI 서비스를 제공할 수 있는지 여부일 것입니다.
댓글