금요일 현재 수정되지 않은 Maverick 모델 "Llama-4-Maverick-17B-128E-Instruct"는 OpenAI의 GPT-4o, Anthropic의 Claude3.5Sonnet 및 Google의 Gemini1.5Pro와 같은 모델보다 순위가 낮습니다. 이러한 모델 중 다수는 몇 달 전에 출시되기도 했습니다.
실적이 저조한 이유는 무엇입니까? Meta는 토요일에 발표된 차트에서 실험적인 Maverick 모델인 Llama-4-Maverick-03-26-Experimental이 "대화 성격에 최적화"되었다고 설명합니다. 플랫폼에서는 인간 평가자가 개별 모델의 출력을 비교하고 선호하는 모델을 선택해야 하기 때문에 이러한 최적화는 분명히 LMArena에서 잘 수행됩니다.
여러 가지 이유로 인해 LMArena는 AI 모델 성능을 측정하는 데 있어 가장 신뢰할 수 있는 지표가 아니었습니다. 그러나 모델을 벤치마크에 맞게 조정하는 것은 오해의 소지가 있을 뿐만 아니라 개발자가 모델이 다양한 환경에서 어떻게 작동할지 정확하게 예측하기 어렵게 만듭니다.
Meta 대변인은 성명에서 Meta가 "모든 유형의 맞춤형 변형"을 시도했다고 말했습니다.
대변인은 "'Llama-4-Maverick-03-26-Experimental'은 우리가 LMArena에서 테스트하고 좋은 성능을 발휘한 채팅 최적화 버전입니다."라고 말했습니다. "우리는 이제 오픈 소스 버전을 출시했으며 개발자가 자신의 사용 사례에 맞게 Llama4를 어떻게 사용자 정의하는지 지켜볼 것입니다. 최종 결과를 보고 지속적인 피드백을 기대하고 있습니다."