전체기사 최신뉴스 GAM
KYD 디데이
경제 과학기술

속보

더보기

서울과기대·테디썸, 라마3-70B 기반 한글 특화 LLM '블라썸' 세계최초 공개

기사입력 : 2024년05월09일 14:21

최종수정 : 2024년05월09일 14:21

※ 본문 글자 크기 조정

  • 더 작게
  • 작게
  • 보통
  • 크게
  • 더 크게

※ 번역할 언어 선택

라마3 70B 모델에 한국어 확장 첫 사례
업스테이지·솔트룩스·마음AI에 도전장
블라썸, 기본 모델 대비 89% 답변 향상

[세종=뉴스핌] 이경태 기자 = 국내 연구진과 인공지능(AI) 기업이 공동연구를 통해 메타의 오픈소스 거대언어모델(LLM)을 활용한 한국어 어휘 확장 대형 모델을 세계 최초로 개발했다. 

이미 오픈소스 기반 LLM 개발 업체인 업스테이지, 솔트룩스, 마음AI에 한발 앞선 기술력으로 도전장을 내민 셈이다.

서울과학기술대학교 다층퍼셉트론(MLP)연구실과 테디썸은 9일 오후께 한국어 최초 70B급 한국어-영어 초거대 언어모델 블라썸(Bllossom)을 완전 공개했다. 이는 현재 가장 좋은 성능으로 평가받는 공개 언어모델인 라마3(LLama3-70B) 기반 모델 중 어휘 확장 모델로는 전세계에서 최초로 꼽힌다.

메타는 지난달 18일(현지 시간) 자체 개발한 오픈소스 거대언어모델(LLM)인 라마(Llama)의 3세대 버전을 무료로 출시했다. 라마 3는 8B 및 70B 매개변수 두 모델로 우선 공개됐다. 라마3은 15조 개의 토큰으로 학습됐다. 

이 가운데 70B 모델은 오픈AI가 개발한 GPT-3.5보다 성능이 좋고 GPT4 성능에 근접한 수준이라는 평가를 일부 받는다. 라마3는 한국어에 특화돼 있는 모델로 평가된다.

테디썸이 라마3 70B 모델을 활용해 자체 개발한 한국어 특화 확장 거대언어모델인 '블라썸'을 허깅페이스에 9일 게재했다. 실제 전체 공개는 이날 오후께 진행된다. [사진=테디썸] 2024.05.09 biggerthanseoul@newspim.com

서울과기대와 테디썸은 라마3 70B모델에 추가적인 어휘확장을 했다.

어휘 확장은 특정 언어의 단어를 추가해 심층적인 표현이 가능하도록 하는 방법이다. 70B급 거대 언어모델은 어휘를 확장하면 새로운 어휘의 표현학습을 위해 엄청난 추가 학습시간 및 비용이 소요된다. 이렇다보니 70B급 모델에 어휘확장이 시도된 사례는 한국어에서는 아직 찾아볼 수 없다. 

이번 블라썸 모델은 서울과기대 슈퍼컴퓨팅센터의 컴퓨팅 지원을 토대로 대량의 GPU를 활용해 어휘확장 및 영어-한국어 지식 연결 학습이 가능했던 것으로 파악됐다.

임경태 서울과기대 인공지능응용학과 교수 연구팀은 이번 모델 개발을 위해 ▲한국어 표현력 강화를 위한 3만개가 넘는 한국어 어휘 추가 ▲한국어 어휘 표상 학습을 위한 대규모 사전학습 ▲한국어-영어 지식 연결을 위한 Parallel 학습 ▲한국어-영어 지식 표현을 위한 지시미세조정(Instruction Tuning) ▲사용자 피드백(feedback) 기반의 강화학습 등을 진행했다.

방대한 영어 지식을 한국어와 연결시키기 위해 직접 구축한 병렬(Parallel) 데이터 셋을 활용했다는 점과 언어학자들이 직접 구축한 정교한 지시미세조정 데이터가 성능을 크게 향상시켰다는 점이 이번 모델 개발에서 주목할 만한 요소다.

테디썸은 이번에 개발한 모델을 전체 공개해 개별적인 추가 학습과 상업적 이용이 가능하다는 점을 강조했다.

이번 모델은 한국어 토큰 확장으로 인해 25% 확장된 컨텍스트 활용이 가능하다. 인간평가와 GPT4 한국어 답변 선호도 평가 결과 GPT3.5와 유사하거나 약간 앞선 결과를 보인 바 있다. 라마3 70B 기본모델 대비 한국어 답변에 대해 89% 더 높은 답변 선호도 평가를 기록했다.

테디썸은 이미 8B 소형 모델은 전세계 기술 공유 플랫폼인 허깅페이스에 공개됐고 70B 거대모델도 이날 함께 공개했다. 개인 GPU에서 작동 가능한 4bit 양자화된 모델과 직접 활용해볼 수 있는 데모도 함께 내놓는다.

함영균 테디썸 대표는 "기존 빅테크에서만 연구개발하고 공개되지 않던 70B 거대 모델을 중소규모 회사 및 연구 그룹에서도 활용할 수 있도록 초거대 언어모델의 민주화에 기여했다는 점에서 의미있는 첫 발자국이라 생각한다"고 말했다.

한편 국내에서 라마3 소형 모델인 8B를 기반으로 자체 LLM 모델을 개발해 공개한 기업은 솔트룩스, 마음AI 등이다. AI 기업 데이터드리븐의 이준범 수석 AI 연구원도 개인적으로 8B 기반 모델을 공개한 바 있다.

biggerthanseoul@newspim.com

[뉴스핌 베스트 기사]

사진
스키즈, K팝 첫 美 빌보드 8연속 정상 [서울=뉴스핌] 최문선 기자 =테이프 '두 잇'(SKZ IT TAPE 'DO IT')'으로 미국 빌보드 메인 앨범차트 '빌보드 200'에서 1위를 차지하며, K팝 최초 '빌보드 200' 8연속 1위라는 기록을 세웠다. 30일(현지시간) 공개된 빌보드의 차트 예고 기사에 따르면, 이번 앨범은 12월 6일 자 '빌보드 200'에서 정상을 차지했다. [서울=뉴스핌] 류기찬 기자 = 빌보드 200 8연속 1위를 차지한 그룹 스트레이 키즈. ryuchan0925@newspim.com 이로써 스트레이 키즈는 자체 기록이었던 K팝 최초 7연속 1위를 넘어, 통산 8연속 1위를 달성하게 됐다. 스트레이 키즈는 2022년 3월 미니 6집 '오디너리'를 시작으로 미니 7집 '맥시던트', 정규 3집 '★★★★★(5-STAR)', 미니 8집 '락스타', 미니 9집 '에이트', 스페셜 앨범 '스키즈합 힙테이프 - 합(SKZHOP HIPTAPE - 合 (HOP))', 그리고 지난 8월 발표한 정규 4집 '카르마'까지 연이어 '빌보드 200' 1위를 차지하며 막강한 글로벌 영향력을 입증해왔다. 1956년 3월 시작된 '빌보드 200' 약 70년 역사에서, 첫 1위 진입 이후 여덟 작품을 연달아 정상에 올린 아티스트는 스트레이 키즈가 최초다. moonddo00@newspim.com 2025-12-01 10:53
사진
국힘 운명 걸린 2일 추경호 영장심사 [서울=뉴스핌] 이재창 정치전문기자 = 국민의힘이 오는 2일 당 진로의 중대한 분수령을 맞는다. 추경호 의원에 대한 법원의 구속 전 피의자 심문(영장실질심사) 결과에 따라 추 의원은 물론 당의 운명이 결정된다. 출구 없는 터널에 갇히느냐, 아니면 희망의 출구를 찾느냐는 영장 발부 여부에 달렸다.  구속영장이 발부되면 국민의힘은 내란 정당 프레임에 갇혀 사실상 생존을 걱정해야 하는 최대 위기를 맞게 된다. 내년 6월 지방선거 승리도 요원해진다. 반대로 영장이 기각되면 내란 정당 프레임에서 벗어나 비상계엄 이후 1년간 계속된 수세 국면에서 탈출할 수 있다. 대대적인 역공이 가능해져 지방선거에서 한판 승부를 겨뤄볼 수 있을 것으로 보인다. [서울=뉴스핌] 최지환 기자 = 장동혁 국민의힘 대표, 송언석 국민의힘 원내대표가 30일 오전 서울 서초구 서울고등검찰청 앞에서 열린 국민의힘 긴급의총에서 의원들과 구호를 외치고 있다. 2025.10.30 choipix16@newspim.com 추 의원의 구속 여부는 비상계엄 1년을 맞는 3일 새벽에 결정될 것으로 예상된다. 추 의원은 내란 중요임무 종사 혐의를 받고 있다. 윤석열 전 대통령의 내란에 협조했는지 여부다. 추 의원의 구속 여부에 중요한 정치적 의미가 부여되는 이유다. 추 의원 구속 여부에 따라 "국민의힘을 위헌 정당 해산으로 몰아가려는 내란몰이 정치공작"(추 의원)인지, 아니면 "의도적으로 (의원 총회) 장소를 변경한 것이 확인되면 내란의 중요 임무에 종사한 내란 공범"(정청래 더불어민주당 대표)인지가 가려지는 것이다. 적어도 정치적으로는 이런 해석이 가능하다. 법리적으로도 위헌 정당 해산에 무게가 실릴 수 있다. 그만큼 정치적 파장은 엄청나다. 구속 여부에 따라 민주당과 국민의힘 중 한 당은 심각한 정치적 타격을 받을 수밖에 없다. 따라서 여야 모두 촉각을 곤두세우고 있다. 이번 추 의원 영장 심사는 2023년 이재명 대통령(당시 민주당 대표) 건을 떠올리게 한다. 이 대통령은 백현동 개발사업 특혜와 쌍방울 대북 송금 의혹 등의 혐의로 체포동의안이 국회를 통과해 구속 심사를 받았다. 여기까지는 동의안이 국회를 통과해 영장 심사를 받는 추 의원과 닮은꼴이다. 당시 이 대통령에 대해 영장이 발부됐다면 이 대통령은 구속됐을 것이고 민주당은 심각한 위기에 빠졌을 것이다. 결과는 정반대였다. 이 대통령은 영장 기각으로 기사회생했고, 민주당도 살길을 찾았다. 추 의원과 국민의힘도 구속 여부에 따라 비슷한 수순을 밟을 것이다. 우선 추 의원에 대한 영장이 발부되면 국민의힘은 내란 정당 프레임에 갇히게 된다. 민주당은 국민의힘에 대해 대대적인 내란 정당 공세를 펼 것이다. 내란 정당 심판론은 민주당의 지방선거 전략이다. 국민의힘은 정당 해산이라는 최악의 위기를 맞을 수도 있다. 민주당은 위헌 정당 해산 심판 청구 카드를 만지작거리고 있다. 추 의원이 구속되면 당시 지도부에 속했던 국민의힘 의원들에 대한 수사가 확대될 가능성이 높다. 수사 대상에 오른 의원은 10여 명으로 알려져 있다. 이 중 일부도 사법 처리될 수 있다는 얘기가 나온다. 당내 갈등도 불거질 수 있다. 이미 비상계엄에 대한 사과와 반성을 놓고 이견이 표출되고 있다. 배현진, 김재섭 의원 등 소장파 의원은 당 지도부에 사과 메시지를 요구하고 이것이 받아들여지지 않으면 집단 행동에 나서겠다는 입장이다. 여기에는 20여 명 안팎이 참여할 것으로 전해졌다. 배 의원은 지난 29일 페이스북에 "진정 끊어야 할 윤석열 시대와는 절연하지 못하고 윤어게인, 신천지 비위를 맞추는 정당이 돼서는 절대로 절대로 내년 지방선거에서 유권자의 눈길조차 얻을 수 없다"며 "윤석열 시대와 절연해야 한다"고 말했다. 이런 와중에 당원 게시판(당게) 논란도 가열되고 있다. 당 지도부가 한동훈 전 대표를 겨냥한 당 게시판 논란에 대해 조사에 착수하겠다고 밝힌 데 따른 것이다. 한 전 대표는 "당을 퇴행시키려는 시도"라고 비판했다. 당게 논란과 사과 반성 메시지 불협화음이 맞물리면서 갈등이 심화할 가능성을 배제할 수 없다. 내란 정당 프레임에 갇히고 여기에 당내 갈등까지 겹치면 중도층 공략은 사실상 불가능해진다. 그렇지 않아도 각종 여론 조사에서 전국적으로 상당한 격차로 밀리는 것으로 나타나고 있다. 지방선거에서 참패할 가능성이 높아지는 것이다.  추 의원에 대한 영장이 기각되면 국민의힘은 내란 정당 프레임에서 벗어날 수 있다. 완전히 탈출하는 것은 아니지만 적어도 이 프레임은 동력이 떨어질 가능성이 높다. 민주당은 조희대 대법원장 등 사법부에 대한 공격에 나서겠지만 내란 정당 공세는 약해질 수밖에 없다. 국민의힘이 일단 기사회생할 수 있다. 국민의힘은 여권에 대한 대대적인 역공에 나설 것으로 보인다. 국민의힘은 3대 특검을 앞세운 민주당의 내란몰이가 입증됐다고 여권을 몰아세울 것으로 예상된다. 비상계엄에 대한 사과와 반성은 없던 일이 될 가능성이 높다. 당 지도부가 당내 갈등을 털어버리고 중도 공략에 나설 경우 지방선거 구도를 혼전 구도로 만들 여지도 없지 않다. 추 의원의 구속 여부가 적어도 연말 연초 정국의 향방을 결정하는 최대 변수가 될 것으로 보인다. 정국 주도권은 물론 지방선거 구도까지 좌우할 가능성이 높다. leejc@newspim.com 2025-12-01 06:00
기사 번역
결과물 출력을 준비하고 있어요.
종목 추적기

S&P 500 기업 중 기사 내용이 영향을 줄 종목 추적

결과물 출력을 준비하고 있어요.

긍정 영향 종목

  • Lockheed Martin Corp. Industrials
    우크라이나 안보 지원 강화 기대감으로 방산 수요 증가 직접적. 미·러 긴장 완화 불확실성 속에서도 방위산업 매출 안정성 강화 예상됨.

부정 영향 종목

  • Caterpillar Inc. Industrials
    우크라이나 전쟁 장기화 시 건설 및 중장비 수요 불확실성 직접적. 글로벌 인프라 투자 지연으로 매출 성장 둔화 가능성 있음.
이 내용에 포함된 데이터와 의견은 뉴스핌 AI가 분석한 결과입니다. 정보 제공 목적으로만 작성되었으며, 특정 종목 매매를 권유하지 않습니다. 투자 판단 및 결과에 대한 책임은 투자자 본인에게 있습니다. 주식 투자는 원금 손실 가능성이 있으므로, 투자 전 충분한 조사와 전문가 상담을 권장합니다.
안다쇼핑
Top으로 이동