Google은 조정 가능한 "사고 예산" 기능을 지원하고 깊이를 켜거나 끌 수 있는 최초의 하이브리드 추론 모델인 Gemini 2.5 Flash를 출시했습니다.추리이용 비용을 절감하는 모드입니다. 현재 Gemini 2.5 Flash 미리보기 버전은 Gemini 제품에 통합되었으며 API 액세스는 개발자에게 열려 있습니다.

보고서에 따르면 사고 모드가 꺼진 경우 Gemini 2.5 Flash의 출력 가격은 $0.6/백만 토큰만큼 낮으며 이는 사고 모드($3.5/백만 토큰)보다 600% 저렴합니다. Google은 생각을 꺼놓은 상태에서도 새 모델이 이전 세대 Gemini 2.0 Flash보다 여전히 더 나은 성능을 발휘한다고 주장합니다.

이 모델은 여러 벤치마크 테스트에서 SOTA 기록을 깨뜨렸습니다. Gemini 2.5 Flash(미리보기 버전)는 ELO 점수 1392로 대형 모델 순위에서 GPT-4.5-미리보기에 이어 2위를 차지했으며 성능은 Grok-3과 동등합니다.
GPQA 지식 질문 및 답변 작업에서 24,000개의 사고 예산을 설정한 모델은 성능을 6% 향상시킬 수 있습니다. 코드 벤치마크 LiveCodeBench에서 성능은 16,000개의 사고 예산에서 가장 잘 수행됩니다.
수학(AIME 2025/2024), 다중 모달 추론(MMMU), 지식 질문 응답(GPQA)과 같은 작업에서 Gemini 2.5 Flash는 확실히 Claude 3.7 Sonnet을 능가하며 전반적인 성능은 OpenAI의 최신 o4-mini 모델과 비슷합니다.
또한 Gemini 2.5 Flash는 공통 벤치마크 "The Last Test for Mankind"에서 12.1%의 높은 점수로 o4-mini에 이어 2위를 차지했습니다.