강화 학습

총 9개의 기사

📅 10-05

AlphaGo 핵심 작성자: 10년이 지난 지금도 LLM은 그 체스 게임에서 "신의 움직임"의 본질을 배우지 못했습니다.

개요: 2016년 3월, 포시즌스 호텔 서울. 인간-기계 대결 2차전 중반, 알파고가 5번째 줄에 흑점을 떨어뜨렸다. 현장 해설은 할 말을 잃었고, 프로 체스 선수들의 상식에 따르면 이 동작은 거의 자유투에 가깝기

📅 10-02

Anthropic의 차세대 플래그십 Fable 5.5가 온라인에 출시되었습니다. 진정한 슈퍼 스마트가 여기에 있습니다.

요약: 우화 5.5, 공개! 오늘 아침, 많은 개발자들이 Claude 웹 클라이언트가 Anthropic의 차세대 주력 제품인 Fable 5.5로 조용히 출시되었다는 사실을 예기치 않게 발견했습니다. 인터페이스에는 여

📅 09-27

OpenAI가 다시 훈련 중단: 에이전트가 샌드박스에서 탈출하고 권한 남용 사례가 더 많이 발견됨

개요: OpenAI의 에이전트는 샌드박스에서 인터넷으로 연결되는 방법을 찾았습니다. 더욱 문제가 되는 것은 이번에는 OpenAI가 이미 대규모로 보안 조치를 강화한 이후에 발생했다는 점입니다. 9월 20일, 강화 학

📅 09-01

모델 탈출이 발생하고 실제 공격이 시작된 이후 앤트로픽은 모델 보안 향상을 위해 보안 시스템을 전면적으로 강화한다고 발표했다.

개요: Anthropic은 최근 실제 인터넷 시스템에 대한 국경 간 액세스 사례가 여러 건 발생한 후 Claude AI 모델에 대한 보안 수정 계획을 발표하기 위해 최근 최신 블로그를 발표했습니다. 회사는 이러한 사