“왜 쓰면 답답하지”…구글, 신형 ‘제미나이4’ 놓고 내부 회의론에 고심

2 hours ago 3

2026년 5월 19일(현지시간) 미국 캘리포니아주 마운틴뷰에서 열린 구글 I/O 개발자 콘퍼런스 행사장에 제미나이 AI 로고가 설치돼 있다. 게티이미지코리아 구글이 차세대 인공지능(AI) 모델 ‘제미나이4 아르곤(Gemini 4 Argon)’을 일부 파트너에게 공개했지만, 내부에서는 실제 코딩 성능이 벤치마크 점수만큼 나오지 않는다는 평가가 제기됐다. 각종 시험에서는 선두권 성적을 냈지만 막상 실제 업무에 투입하면 결과가 고르지 않다는 지적이다.9월 30일(현지시간) 블룸버그통신에 따르면 구글은 이날 신뢰할 수 있는 소수의 사이버보안 파트너에게 제미나이4를 우선 공개했다. 추가 테스트를 거쳐 유료 이용자부터 사용 범위를 확대할 예정이다.구글은 제미나이4가 여러 벤치마크에서 최고 수준의 점수를 기록했고, 보안 능력을 측정하는 한 평가에서는 오픈AI의 ‘아스트라(Astra)’ 모델을 앞섰다고 밝혔다.그러나 개발 과정에 직접 접근한 일부 직원들은 벤치마크 성적과 실제 사용 경험 사이에 차이가 있다고 전했다. 널리 쓰이는 성능평가에서는 좋은 결과를 내지만 일부 코딩 작업에서는 기대에 못 미친다는 것이다.구글은 제미나이4가 코딩 등에서 기대에 못 미치고 있다는 평가는 부정확하다고 반박했다.● 시험 점수는 높은데 실전은 다르다?…AI 업계의 ‘벤치맥싱’블룸버그가 취재한 내부 관계자들에 따르면 제미나이4의 코딩 성능은 작업에 따라 편차가 있었다. 한 관계자는 앱이나 웹사이트의 화면과 사용 경험을 만드는 프런트엔드 디자인 분야에서 특히 강점을 보이지 못했다고 전했다.AI 코딩 도구 시장에서는 오픈AI와 앤스로픽 등 경쟁사들도 자체 코딩 에이전트와 관련 서비스를 빠르게 확대하고 있다. 구글로서는 실제 개발 업무에서 체감할 수 있는 성능이 중요해진 상황이다.AI 업계에서는 벤치마크 점수를 끌어올리는 데 개발 역량이 지나치게 집중되는 현상을 ‘벤치맥싱(benchmaxxing)’이라고 부른다. 고객과 기업들이 모델을 비교할 때 벤치마크 점수를 많이 참고하다 보니 실제 제품의 사용성보다 시험 성적에 맞춰 모델을 최적화할 유인이 커진다는 것이다.AI 스타트업 서지AI의 에드윈 첸 창업자는 벤치마크에 지나치게 의존하면 특정 프로그래밍 언어로 코드를 잘 작성하는 데 집중하게 되고, 실제로 쓰기 편하거나 완성도 높은 애플리케이션을 만드는 능력은 충분히 평가되지 않을 수 있다고 지적했다.첸은 이를 대학입학시험에 비유했다. 그는 “아이가 SA...

Read Entire Article