마이크로소프트는 오늘 자체 개발한 AI 모델 캠프를 더욱 확장하고 고화질 이미지 생성 및 편집 모델인 MAI-Image-2.5-Pro를 공식 출시했으며, 지연 시간이 짧은 텍스트 음성 변환 모델인 MAI-Voice-2-Flash의 공개 베타를 출시했다고 발표했습니다.

현재까지 Microsoft의 가장 정확한 이미지 생성 모델인 MAI-Image-2.5-Pro는 세련된 이미지 생성, 2차 편집, 메인 시각적 포스터 디자인 및 보다 정확한 텍스트 렌더링이 필요한 애플리케이션 시나리오를 위해 설계되었습니다. 가격 전략 측면에서 이 모델은 텍스트 입력 토큰 백만 개당 미화 5달러, 이미지 입력 토큰 백만 개당 미화 8달러, 이미지 출력 토큰 백만 개당 미화 106달러에 판매됩니다. 현재 개발자와 사용자는 MAI Playground 플랫폼에서 이 모델을 무료로 경험할 수 있습니다.
동시에 Microsoft는 고객 서비스 로봇과 같은 동시성이 높고 대기 시간이 짧은 음성 애플리케이션 시나리오에 중점을 둔 MAI-Voice-2-Flash를 출시했습니다. 공식 데이터에 따르면 자연스러운 억양과 고품질 음질을 유지하면서 MAI-Voice-2-Flash의 작동 속도는 두 배로 향상되고 비용은 32% 절감되었습니다. 가격은 백만 자당 15달러입니다.
Microsoft는 자사의 핵심 사업 중 다수가 자체 개발한 MAI 시리즈 모델에 완전히 통합되었다고 밝혔습니다. 예를 들어 Bing Image Creator는 MAI-Image-2.5에 의해 구동되도록 완전히 전환되었으며 PowerPoint의 그래프 생성 기능도 이 모델에 연결되었습니다. 기존에 채택한 타사 솔루션에 비해 자체 개발 모델로 전환한 후 GPU 비용이 최대 84% 절감되었습니다. OneDrive에서 MAI-Image-2.5를 적용하면 이미지 편집 저장률이 26% 증가하고 P95 대기 시간이 약 25% 감소합니다. 또한 MAI-Voice-2-Flash는 Dynamics 365 문의 센터에서 처음 사용되어 GPU 비용을 최대 89% 절감했으며 개발자가 음성 상호 작용 에이전트를 구축할 수 있도록 Azure Voice Live의 일부로 사용할 수 있습니다. 다국어 전사 모델 MAI-Transcribe-1.5는 또한 Dragon Copilot에 58개 언어에 대한 받아쓰기 서비스를 성공적으로 제공했습니다.