X

'제미나이4' 공개에도…실제성능 두고 구글 내부 엇갈려

이 기사 AI가 핵심만 딱!
애니메이션 이미지
김정유 기자I 2026.10.01 18:53:37

Google 검색에서 이데일리 기사를 더 자주 볼 수 있습니다.

블룸버그통신, 내부자 인용해 "실제 성능 의구심" 보도
벤치마크 점수에만 초점, 일부선 "특정 코딩에 난항"
구글 내부도 엇갈려, 전문가 "벤치맥싱 현상 빠졌을수도"

[이데일리 김정유 기자] 구글이 플래그십 인공지능(AI) 모델 ‘제미나이 4 아르곤’를 출시했지만, 정작 회사 내부에선 코딩 등 핵심 영역에서의 실제 성능에 의구심이 증폭되고 있다고 블룸버그통신이 1일(현지시간) 보도했다.

사진=구글
사진=구글
블룸버그통신은 내부 관계자를 인용해 제미나이4는 범용 벤치마크에선 우수한 성능을 보였지만, 내부 임직원들이 실제 업무에 투입했을 땐 기대 이하 성능을 보였다고 전했다. 익명을 전제한 내부 관계자들은 블룸버그통신에 “해당 모델이 특정 코딩 작업을 하는데 난항을 겪고 있다”고 밝혔다.

구글은 이날 소수 보안 파트너사들을 대상으로 제미나이4를 선공개했다. 구글 측은 주요 벤치마크 테스트에서 제미나이4가 최고 수준의 점수를 기록했고, 특히 보안 역량을 측정하는 테스트에선 오픈AI의 ‘아스트라’를 제쳤다고도 했다.

하지만 구글 내부의 시각은 엇갈리고 있다. 일부 내부 직원들은 앤스로픽의 ‘페이블’과 오픈AI의 아스트라 모델이 제미나이보다 빠른 속도로 발전하고 있어, 제미나이4가 최고 성능을 발휘하더라도 일부 영역에서는 경쟁사 모델에 뒤처질 수 있다고 보고 있다. 반면, 이번 모델이 타사 AI 모델을 충분히 추격하고 있다는 내부 의견도 있다.

구글에 제미나이4의 성공은 기업의 사활이 걸린 문제다. 구글의 핵심 수익원인 검색 서비스 상단의 AI 답변을 비롯해 맵, 지메일, 크롬 등 자사 거의 모든 제품군에 해당 모델이 탑재돼서다.

오픈AI와 앤스로픽도 단순히 모델을 파는 것에 그치지 않고 코딩 에이전트를 포함한 자체 제품 생태계를 빠르게 구축 중이다. 구글이 차세대 최첨단 모델을 제때 선보이지 못할 경우, 검색부터 미래 플랫폼으로의 우위마저 뺏길 수 있다는 우려에서다.

IT전문가들은 구글이 엔지니어들이 실제 유용한 제품을 만들기보다 점수를 올리는 데 치중하는 이른바 ‘벤치맥싱’(benchmaxxing) 현상에 빠졌을 수 있다고 지적한다.

AI 스타트업 서지 AI의 창업자 에드윈 첸은 “비유하자면 ‘아이의 SAT 점수가 잘 나왔다’고 자랑하는 것과 같지만, SAT 점수가 곧 실무 능력으로 이어지지는 않는다”고 꼬집었다.

이런 가운데 구글내 핵심 AI 연구 인력의 이탈도 이어지고 있다. 엔지니어 선구자 제프 딘, 노벨상 수상자 존 덤퍼, 트랜스포머 기술 창시자 중 한 명인 노암 샤지어 등이 대표적이다.

구글이 내부 진통을 겪으며 추격을 시도하는 사이, 경쟁사들은 거침없는 행보를 이어가고 있다. AI 에이전트의 외부 시스템 해킹 등 일련의 사고로 고성능 모델 개발 속도 조절론이 제기되는 와중에도 메타는 AI에이전트 ‘뮤즈’를 전격 출시해 흥행 중이다.

이 기사 AI가 핵심만 딱!
애니메이션 이미지

주요 뉴스

ⓒ종합 경제정보 미디어 이데일리 - 상업적 무단전재 & 재배포 금지