본문 바로가기 오늘의취미 - 지능 개발을 위한 3D 메탈퍼즐 출시 보기 →
재미있는셀럽뉴스 재미있는셀럽뉴스

구글, ‘젬마 4′ 온디바이스 버전 QAT 공개…“메모리 1GB로 압축”

Justin Parker 읽는 시간 약 3분

구글, ‘젬마 4' 온디바이스 버전 QAT 공개…“메모리 1GB로 압축”

구글, ‘젬마 4' 온디바이스 버전 QAT 공개…“메모리 1GB로 압축”





모바일 기기에서도 구동 가능한 경량 AI 모델 등장

구글이 자사의 인공지능 모델을 스마트폰이나 작은 전자기기에서도 쉽게 사용할 수 있도록 개선한 새로운 버전을 내놓았습니다. 양자화 인식 학습이라는 특별한 기술을 적용해, 모델의 용량을 1기가바이트 정도로 줄이면서도 성능은 거의 그대로 유지했다고 합니다.

이 기술 덕분에 고성능 AI를 서버가 아닌 개인 기기에서 바로 실행할 수 있는 시대가 한층 가까워졌습니다.

세 가지 형식으로 제공되는 최적화 모델

이번에 공개된 모델은 용도에 따라 세 가지 방식으로 제공됩니다.

• 기본 형식(BF16): 품질 기준이 되는 원본 버전으로, 메모리를 9.6GB에서 15GB 정도 사용합니다. 주로 서버나 고성능 컴퓨터에 적합합니다.

• 일반 압축 형식(Q4_0 QAT): 용량을 3.2GB~5GB로 줄여 일반 소비자용 그래픽카드에서도 충분히 실행할 수 있습니다. 작은 컴퓨터 보드에서도 작동한 사례가 있습니다.

• 모바일 전용 형식: 가장 주목받는 버전으로, 약 1GB까지 크기를 줄였습니다. 음성이나 영상 처리 기능을 빼면 1GB 이하로도 운영 가능해 스마트폰에 최적화되어 있습니다.

학습 과정에서 압축을 미리 반영하는 기술

일반적인 AI 압축 기술은 학습이 끝난 뒤 모델을 줄이는 방식이라 성능이 떨어질 수 있습니다. 하지만 양자화 인식 학습은 학습 단계에서부터 압축 상황을 미리 시뮬레이션해 모델 스스로 성능 손실을 보완하도록 만듭니다.

구글은 약 5천 단계의 추가 학습을 통해 기존 압축 방식에서 발생하던 성능 저하를 54%나 줄였다고 밝혔습니다.

모바일 하드웨어에 맞춘 네 가지 핵심 기술

모바일 기기에 최적화하기 위해 네 가지 특별한 기술이 적용되었습니다.

먼저 정적 활성화 기법으로 계산 부담을 줄였고, 채널 단위 양자화를 통해 모바일 AI 가속기에 맞게 조정했습니다.

여기에 선택적 2비트 압축과 메모리 캐시 최적화를 더해 용량을 추가로 절감하면서도, 중요한 추론 부분은 높은 정밀도를 유지해 성능 저하를 최소화했습니다.

실사용 전 성능 검증 필요

구글은 현재 공개한 정보가 내부 평가를 기반으로 한 것이며, 독립적인 성능 검증 결과는 아직 나오지 않았다고 설명했습니다.

따라서 개발자들은 실제 서비스에 적용하기 전에 자신의 하드웨어 환경에서 직접 성능을 확인해볼 필요가 있습니다.

이번 기술 공개로 스마트폰, 노트북, 소형 전자기기에서 실행 가능한 AI 생태계가 더욱 확대될 것으로 기대됩니다.

Justin Parker

Justin Parker
함께 보면 좋은 글

댓글 0

첫 댓글을 남겨보세요.

광고 차단 알림

광고 클릭 제한을 초과하여 광고가 차단되었습니다.

단시간에 반복적인 광고 클릭은 시스템에 의해 감지되며, IP가 수집되어 사이트 관리자가 확인 가능합니다.