Gemini 3.8 Flash와 보안 특화 모델 Flash Cyber 공개

1 hour ago 2

Google이 6주 사이 세 번째 Flash 모델을 출시하며, Gemini 3.8 Flash는 장기 코딩·에이전트 작업을, Flash Cyber는 취약점 탐지·자동 패치를 강화함 3.8 Flash는 3.7 Flash와 같은 속도와 도입 가격인 입력 100만 토큰당 $0.75, 출력 100만 토큰당 $3.75를 유지하면서 소프트웨어 엔지니어링과 다단계 추론 성능을 높임 복잡한 작업에서는 추론 단계와 도구 호출을 늘려 성능을 극대화하며, HLE-Verified 54.9% 를 기록했지만 높은 노력 수준에서는 토큰 사용량도 증가할 수 있음 3.8 Flash Cyber는 20개 프로그래밍 언어를 포괄한 내부 취약점 탐지 평가에서 70% 이상 성공률, CWE-Bench 자동 패치 평가에서 pass@1 47.2% 를 달성함 일반 3.8 Flash는 개발자·기업·소비자에게 제공되지만, 공격 기능보다 방어 역량을 강화한 Flash Cyber는 완화 조치가 더 허용적이어서 Fairwind Program의 신뢰할 수 있는 방어자만 이용할 수 있음 공통 기반에서 역할을 나눈 두 모델 Gemini 3.7 Flash 출시 3주 만이자 6주 사이 세 번째 Flash 릴리스로 Gemini 3.8을 공개함 두 모델은 배포 환경은 다르지만 동일한 기반 지능을 사용하며, 장시간 실행되는 에이전트 루프가 모델을 반복 평가하고 개선함 공통 코어의 코딩·추론 향상에는 사이버 보안처럼 난도가 높은 영역에서의 엄격한 훈련이 기여함 모델별 역할은 다음과 같음 Gemini 3.8 Flash: 소프트웨어 엔지니어링, 에이전트 작업, 전문 영역의 중요 다단계 추론을 개선한 범용 모델 Gemini 3.8 Flash Cyber: 취약점 탐지와 자동 패치에 특화됐으며 Fairwind Program을 통해 신뢰할 수 있는 방어자에게 제공됨 Gemini 3.8 Flash의 장기 작업 성능 DeepSWE v1.1 장기 소프트웨어 엔지니어링 평가에서 복잡한 엔지니어링 문제를 처음부터 끝까지 자율적으로 해결하며, 더 큰 다수의 프런티어 모델을 낮은 비용으로 앞섬 전문 지식이 필요한 기업용 자율 작업에서도 3.7 Flash와 다른 프런티어 모델보다 높은 성능을 보임 Vals Finance Agent V2는 정량 분석과 금융 보고 능력을 평가함 Harvey's Legal Agent Benchmark는 법률 분야의 에이전트 능력을 평가함 HLE-Verified 54.9% 를 기록...

Read Entire Article