전체기사 최신뉴스 GAM
KYD 디데이
경제 과학기술

속보

더보기

KAIST, GPT-4 버전의 시각 멀티모달 성능 뛰어넘는 대형 언어모델 개발

기사입력 :

최종수정 :

※ 본문 글자 크기 조정

  • 더 작게
  • 작게
  • 보통
  • 크게
  • 더 크게

※ 번역할 언어 선택

공개형 멀티모달 LLM 'CoLLaVO'·'MoAI' 개발

[세종=뉴스핌] 이경태 기자 = 한국과학기술원(KAIST)은 전기및전자공학부 노용만 교수 연구팀이 오픈AI(OpenAI)의 GPT-4 등 기업에서 비공개하고 있는 상업 모델인 초대형 언어모델의 시각 성능을 뛰어넘는 공개형 멀티모달 대형 언어모델을 개발해 출시했다고 20일 밝혔다.

노용만 교수 연구팀은 단순히 모델의 크기를 키우거나 고품질의 시각적 지시 조정 데이터셋을 만들지 않고 멀티모달 대형언어모델의 시각 성능을 획기적으로 높인 콜라보(CoLLaVO), 모아이(MoAI) 2가지 기술을 연속적으로 개발했다.

MoAI 멀티모달 대형언어모델 성능 [자료=한국과학기술원] 2024.06.20 biggerthanseoul@newspim.com

연구팀이 개발한 첫번째 기술인 '콜라보(CoLLaVO)'는 현존하는 공개형 멀티모달 대형언어모델이 비공개형 모델의 성능에 비해 현저하게 낮은 이유를 일차적으로 물체 수준에 대한 이미지 이해 능력이 현저하게 떨어진다는 것을 먼저 검증했다.

해당 능력을 효율적으로 증가시켜 시각-언어 태스크에 대한 성능을 향상 하기 위해 연구팀은 이미지 내의 정보를 배경과 물체 단위로 분할하고 각 배경 및 물체에 대한 정보를 멀티모달 대형언어모델에 입력으로 직접 넣어주는 새로운 방법인 '크레용 프롬프트(Crayon Prompt)'라는 시각적 프롬프트를 새롭게 제안했다.

시각적 지시 조정 단계에서 크레용 프롬프트로 학습한 정보를 잃어버리지 않기 위해 연구팀은 물체 수준 이미지 이해 능력과 시각-언어 태스크 처리 능력을 서로 다른 파라미터로 학습해 서로 간의 정보를 잃지 않게 만드는 획기적인 학습 전략인 '듀얼 큐로라(Dual QLoRA)'를 제안했다.

연구팀은 이를 통해 콜라보(CoLLaVO) 멀티모달 대형언어모델은 이미지 내에서 배경 및 물체를 구분하는 능력이 뛰어나 일차원적인 시각 구분 능력이 크게 향상됐다고 전했다.

두 번째 대형언어모델인 '모아이(MoAI)'는 인간이 사물을 판단할 때 물체의 존재, 상태, 물체 간의 상호작용, 배경에 대한 이해, 텍스트에 대한 이해 등으로부터 상황을 판단하는 인지과학적인 요소에 영감을 받아서 만들었다는 게 연구팀의 설명이다.

기존 멀티모달 대형언어모델은 텍스트에 의미적으로 정렬된 시각 인코더(vision encoder)만을 사용한다. 이미지 픽셀 수준에서의 상세하고 종합적인 실세계 장면 이해가 부족하다는 점을 연구팀은 지적했다. 연구팀은 이런 컴퓨터 비전 모델들의 결과를 받으면 모두 인간이 이해할 수 있는 언어로 변환한 뒤에 멀티모달 대형언어모델에 입력으로 직접 사용했다.

노용만 교수는 "연구팀에서 개발한 공개형 멀티모달 대형언어모델이 허깅페이스 일간 화제의 논문(Huggingface Daily Papers)에 추천됐고, 각종 SNS를 통해 세계 연구자에게 알려지고 있다"며 "모든 모델을 공개형 대형언어모델로 출시 했기 때문에 이 연구모델이 멀티모달 대형언어모델 발전에 기여할 것"이라고 말했다.

biggerthanseoul@newspim.com

[뉴스핌 베스트 기사]

사진
'모텔 연쇄 살인' 피의자 신상공개 검토 [서울=뉴스핌] 조준경 기자 = 검찰이 '강북 모텔 연쇄 살인 사건' 피의자인 20대 여성 김모 씨에 대한 신상공개 여부를 검토 중이다. 26일 검찰 따르면 서울북부지검은 김씨 신상 공개 여부를 논의하기 위해 신상정보공개심의위원회 개최를 검토하고 있다. [서울=뉴스핌] 최상수 기자 = 서울북부지검 검찰은 2024년 1월 시행된 중대범죄신상공개법에 따라 강력범죄 등 특정중대범죄 혐의가 있는 피의자를 신상정보공개심의위원회에 회부해 신상 공개 여부를 결정할 수 있다. 피해자 유족도 김씨 신상 정보 공개를 요구하고 있다. 김씨 범행으로 숨진 두 번째 피해자 A씨 유족 법률대리인인 남언호 변호사는 이날 보도자료를 통해 "(김씨 범행은) 우리 사회가 경험한 가장 냉혹하고 계획적인 연쇄 범죄 중 하나"라며 "그럼에도 경찰이 신상 공개를 하지 않겠다는 내부 방침을 정한 사실을 납득할 수 없다"고 강조했다.  이에 앞서 서울 강북경찰서는 지난 19일 오전 살인과 마약류 관리법 위반 혐의로 김씨를 서울북부지검에 구속 송치했다. 김씨는 지난해 12월 중순부터 이달 9일까지 20대 남성 3명에게 벤조디아제핀계 약물이 든 음료를 건네 2명을 숨지게 하고 1명이 의식을 잃게 한 혐의를 받는다. 김씨는 경찰 조사에서 병원에서 처방받은 약물을 숙취해소제에 타서 들고 다녔다고 진술했다. 또 남성들에게는 모텔 등에서 의견이 충돌해 이를 건넸다고 주장했다. 그러나 경찰은 김씨가 첫 범행 이후 약물 양을 늘렸다고 진술한 점, 휴대전화 포렌식 자료 등을 볼 때 사망 가능성을 충분히 인지했던 것으로 판단하고 상해치사가 아닌 살인죄를 적용해 검찰에 송치했다. 다만 경찰은 이번 사건이 신상공개 요건을 충족하지 않는다고 판단해 김씨 신상을 비공개했다.  한편 경찰은 지난달 24일 김씨가 다른 남성에게 약물이 든 음료를 건네 의식을 잃게 한 정황을 추가로 확인하고 조사하고 있다. calebcao@newspim.com 2026-02-26 17:38
사진
이부진, 아들 서울대 입학식 참석 [서울=뉴스핌] 남라다 기자 = 이부진 호텔신라 사장이 26일 서울 관악구 서울대학교에서 열린 2026학년도 입학식에 참석해 아들 임동현군의 입학을 축하했다. 이 사장은 이날 모친인 홍라희 리움미술관 명예관장과 함께 서울대를 찾아 임군의 입학을 기념해 사진을 찍기도 했다.  [서울=뉴스핌] 김현우 기자 = 이부진 호텔신라 사장(사진 왼쪽)과 홍라희 리움미술관 명예관장이 26일 서울 관악구 서울대학교 2026학년도 입학식에 참석해 아들 임동현군의 입학을 축하하고 있다.  khwphoto@newspim.com 임군은 최근 서울 휘문고등학교를 졸업하고 2026학년도 수시모집 전형으로 서울대 경제학부에 합격했다. 고교 시절 내신 성적이 상위권이었으며 대학수학능력시험에서도 한 문제만 틀린 것으로 알려졌다. 서울대 26학번이 된 임군은 외삼촌인 이재용 삼성전자 회장(서울대 동양사학과 87학번)의 후배가 됐다. 이날 입학식 현장에서 이 사장의 패션도 눈길을 끌었다. 이 사장은 크림색 계열의 디올 재킷에 에르메스 버킨백을 매치한 차분한 차림으로 참석했다. 단정한 헤어스타일과 절제된 스타일링으로 재계 인사다운 단아한 이미지를 보였다는 평가가 나왔다. [서울=뉴스핌] 김현우 기자 = 이부진 호텔신라 사장(사진 왼쪽)과 홍라희 리움미술관 명예관장이 26일 서울 관악구 서울대학교 2026학년도 입학식에 참석해 아들 임동현 군의 입학을 축하하고 있다. khwphoto@newspim.com nrd@newspim.com 2026-02-26 16:27
기사 번역
결과물 출력을 준비하고 있어요.
종목 추적기

S&P 500 기업 중 기사 내용이 영향을 줄 종목 추적

결과물 출력을 준비하고 있어요.

긍정 영향 종목

  • Lockheed Martin Corp. Industrials
    우크라이나 안보 지원 강화 기대감으로 방산 수요 증가 직접적. 미·러 긴장 완화 불확실성 속에서도 방위산업 매출 안정성 강화 예상됨.

부정 영향 종목

  • Caterpillar Inc. Industrials
    우크라이나 전쟁 장기화 시 건설 및 중장비 수요 불확실성 직접적. 글로벌 인프라 투자 지연으로 매출 성장 둔화 가능성 있음.
이 내용에 포함된 데이터와 의견은 뉴스핌 AI가 분석한 결과입니다. 정보 제공 목적으로만 작성되었으며, 특정 종목 매매를 권유하지 않습니다. 투자 판단 및 결과에 대한 책임은 투자자 본인에게 있습니다. 주식 투자는 원금 손실 가능성이 있으므로, 투자 전 충분한 조사와 전문가 상담을 권장합니다.
안다쇼핑
Top으로 이동