전체기사 최신뉴스 GAM
KYD 디데이
홈 산업 생활경제

속보

더보기

[김정호의 4차혁명 오딧세이] 아이에게서 배우는 AI 강화학습

기사입력 :

최종수정 :

※ 본문 글자 크기 조정

  • 더 작게
  • 작게
  • 보통
  • 크게
  • 더 크게

※ 번역할 언어 선택

우리는 어떻게 배우는가

필자가 처음 영어 공부를 시작한 것은 중학교 들어가기 전, 초등학교 6학년 때로 기억한다. 아마 공책에 a, b, c, d 알파벳을 필기체와 출판 서체로 연습한 기억이 난다. 그리고 영어로 배운 첫 문장이 “I am a boy,아니면 “You are a girl” 이 아닌가 생각한다.

        김정호 교수

본격적으로 영어를 공부한 시기는 고등학교 때이다. 그때 사용했던 영어 교재가 ‘성문종합영어’, ‘영어의 왕도’ , 그리고 ‘1200제’였다. 특히 그 중에 가장 어려운 교재가 ‘1200제”이었는데 아마도 일본 참고서를 번역한 책으로 기억한다.

그런데 이렇게 영어 공부를 시작할 때 재일 재미없었던 부분이 문법을 외우는 과정이었다. 명사, 대명사, 동사, 가정법 등 외우는 내용도 많고, 예외도 많았다. 그 규칙을 파악하고 외우고 이를 토대로 문장을 이해하고, 해석하고 작문하였다.

인공지능에서도 전통적으로 이와 비슷한 학습 방법을 써 왔다. 전통적 인공지능에서는 먼저 뇌와 지능의 동작 원리를 이해하고, 그에 맞추어 모델을 세우고 이를 컴퓨터 프로그램으로 구현하는 방법이다. 이 방법은 인간의 뇌의 동작을 인간의 논리로 파악하려 하는 방법이다. 영어 배울 때 문법으로 언어를 배우려는 시도와 같은 방법이다.

성문종합영어 참고서 내의 영어 문법과 작문 부분, [출처: tistory]


하지만 최근 딥뉴럴네트워크(DNN)으로 표현하는 인공지능은 빅데이터를 제공하고 그 데이터를 통해서 인공지능이 스스로 학습하는 방법이다. 이러한 방법을 ‘머신러닝' 인공지능이라고 한다. 여기서는 데이터를 믿고 학습한다. 이러한 머신러닝 학습 방법 중에서 인공지능 스스로 데이터를 만들어 내고 최적의 답을 만들어 내는 방법이 등장했는데, 이를 ‘강화학습(RL: Reinforcement Learning)’이라고 한다. 이를테면 컴퓨터 스스로가 자율학습을 해서 지능을 쌓아가는 방법이다.

아기가 처음 말을 배울 때 하는 말을 ‘옹알이’라고 한다. 옹알이를 통해서 엄마와 소통하면서 말을 배워나간다. 그때 처음 배우는 말이 ‘엄마’, ‘맘마’, ‘아빠’ 와 같은 단어들이다. 맘마라고 부르면 엄마가 우유를 주고, 엄마라고 부르면 엄마가 따뜻한 눈길을 주고 사랑으로 안아준다. 이처럼 아기가 언어를 배우는 과정에서는 아기가 주변 환경과 교류하면서 보상을 얻는 과정에서 말을 배운다. 우리처럼 문법을 통해서 배우지 않는다.

또한 아기가 걸음마를 배우는 과정도 비슷하다. 걷고, 넘어지고 다치면서, 시행착오를 거치면서 아장 아장 걷기를 배운다. 이때 환경은 거실 마루이고, 보상은 걷는 기쁨과 엄마의 웃음이다. 이처럼 주변환경 속에서 행동하고 보상 받으면서, 그 결과 최선의 결정과 행동을 하면서 학습하는 방법을 ‘강화학습’ 인공지능이라고 한다. 그래서 강화학습은 인간이 본능적으로 배우는 학습 방법이다.

아기가 옹알이를 하며 말을 배우고 있다. [출처: tistory]


시행착오 통한 강화학습, 로봇과 게임에도 적용 가능

강화학습에서는 주변 환경(Environment)이 있고 그 상태(State)를 벡터로 표현한다. 다양한 시도(Action)와 보상(Reward)를 얻으면서 스토리(Episode)를 만들고, 그 결과로 환경을 파악해 간다. 이렇게 시행착오를 거쳐서 학습하게 된다. 그리고 최적의 정책(Policy)을 찾아간다.

생쥐의 미로 찾기 게임이 강화학습의 좋은 한 예가 된다. 이 때 미로의 구조가 환경이 되고, 최종적으로 치즈를 먹게 되면 보상을 얻게 된다. 그렇지만 최단 시간 내에 찾아야 하는 조건이 붙게 된다. 이처럼 각 상태에 따라 미래를 정할 수 있고, 과거는 묻지 않는 조건을 강화학습에서는 마르코프(Markov) 조건이라고 한다. 강화학습을 적용하려면 마크코프 조건을 만족해야 한다. 과거는 묻지 않고, 현재 상태로만 그의 미래를 점치는 조건이다. 과거까지 따지면 너무 복잡해서 보상을 예측하기 어렵기 때문이다.

강화학습은 로봇의 걷기 제어에도 적용될 수 있다. 로봇이 넘어지고 걷기를 반복하면서 인간에게 가까운 최적의 보행 제어를 이러한 강화 학습 방법으로 찾을 수 있다. 마찬가지로 이러한 학습은 드론의 조종, 헬리콥터 조종, 항공기의 조종 제어에 사용할 수 있다. 더 나아가 자율주행 자동차의 자동 운전에 강화학습이 사용되어 주어진 조건(State) 에서 최적의 자율 운전을 할 수 있다. 이때 최종적으로 주어지는 보상이 연료비의 절약이나 사고율 저하, 안전성 향상 등이 될 수 있다.

이때 시행착오의 과정은 시간과 비용이 든다. 자동차를 부수기에는 비용이 비싸다. 경우에 따라 시행과 보상을 컴퓨터 시뮬레이션으로 대신 하기도 한다.

강화학습은 게임에 적용되기도 한다. 블록깨기(Atari Breakout)게임을 강화학습으로 하는 경우 금방 최적의 조건을 찾는 것을 볼 수 있었다. 돌이 블록 뒤로 들어가면 여러 번의 반사과정을 반복하면서 저절로 대부분의 블록이 격파되고 점수가 올라간다.

그래서 강화학습을 수행한 컴퓨터와의 인간과의 게임이 이제 더 이상 상대가 되지 않는다. 인공지능은 이런 경우뿐만 아니라 주식투자, 재고관리, 웹사이트의 광고 배치, 상품추천 등 다양한 분야에서 중요한 결정을 인간을 대신해서 할 수 있다. 인간처럼 이 때 보상은 경영상 이익이 된다. 컴퓨터는 졸거나, 피곤해 하거나, 술을 마시지도 불평하지도 않는다. 강화 학습으로 훈련한 보상 체계만 따를 뿐이다.

생쥐 미로게임에서 다양한 시도를 통해 치즈를 얻는 길을 찾는 인공지능 강화학습의 내부 구조, [출처: KAIST]
강화학습 인공지능으로 무장한 컴퓨터의 블록깨기(Atari Breakout) 게임, [출처:Ecosia]


강화학습은 인공지능의 '무기' 

이와 같이 강화학습은 데이터와 정답 없이 스스로 학습이 가능한 인공지능 알고리즘이다. 공부로 치면 자율학습 공부 방법이다. 인공지능이 데이터를 이용해서 학습하기 위해서는 데이터를 모으는 작업에서 많은 비용을 지불 해야 한다. 데이터 수거 장치, 전송 장치, 저장 장치에 투자해야 한다. 5G 무선 통신도 투자 비용이 크다. 그러면서도 데이터를 모으려면 개인의 허락을 받아야 하고, 개인 정보 보호 문제도 극복해야 한다. 그렇지만 강화학습은 데이터 없이 학습한다. 인공지능이 점점 강력해지는 또 다른 이유이기도 하다. 

 

joungho@kaist.ac.kr

[김정호 카이스트 전기 및 전자공학과 교수]

[뉴스핌 베스트 기사]

사진
누리호, 5차 발사 성공...군집위성 5기 궤도 안착 [세종=뉴스핌] 이경태 기자 = 한국형 발사체 누리호가 5차 비행을 마치고 위성 15기를 모두 성공적으로 사출했다. 같은 임무를 수행하는 초소형군집위성(네온샛) 5기를 한 번의 발사로 순차 투입하며 국내 첫 군집위성 발사를 해냈다. 우주항공청과 한국항공우주연구원에 따르면 누리호는 7일 낮 12시25분 전남 고흥 나로우주센터 제2발사대에서 이륙해 낮 12시45분 비행을 마쳤다. 우주청은 초소형군집위성 5기와 큐브위성 10기가 성공적으로 사출됐다고 밝혔다. [서울=뉴스핌] 누리호가 7일 전남 나로우주센터 제2발사대에서 우주를 향해 날아 오르고 있다. [사진=한국항공우주연구원] 2026.10.07 photo@newspim.com 누리호는 이륙 뒤 1단과 페어링, 2단을 차례로 분리하고 3단 엔진으로 고도 약 575km에 올랐다. 이어 네온샛 2호를 시작으로 5기를 35~40초 간격으로 서로 다른 방향으로 내보냈고, 부탑재위성인 큐브위성 10기를 10초 간격으로 2기씩 사출했다. 오태석 우주항공청장은 이날 오후 1시께 나로우주센터 임무지휘센터(MDC)에서 "오늘 누리호는 예정된 발사 시각 12시 25분에 정상적으로 발사되었으며, 이는 그간 발사 이력상 최초로 예정 시간에 발사가 이루어진 사례"라고 말했다. 오 청장은 현재까지 확인된 비행 정보와 영상을 종합하면 누리호가 예정된 비행 절차에 따라 목표 궤도에 도달한 것으로 확인되고 있으며, 초소형군집위성 5기도 계획된 순서에 따라 모두 분리된 것으로 확인되고 있다고 설명했다. 그는 "현재까지 확인된 위성 분리 과정과 비행 상황을 종합하면 위성 분리는 당초 계획에 따라 정상적으로 수행된 것으로 추정된다"고 말했다. 오 청장은 이번 발사의 가장 중요한 임무가 군집위성 5기를 우주공간에서 안전하게 분리하는 것이었다며, 이를 위해 발사체 3단이 설정된 각도와 시간 간격에 따라 자세를 바꿔가며 위성을 순차적으로 분리하는 새로운 기동 방식을 적용했다고 밝혔다. 항우연은 나로우주센터와 제주추적소, 필리핀 동쪽의 팔라우추적소에서 받은 발사체의 작동 상태와 위치·속도·자세 정보를 바탕으로 누리호가 목표 궤도에 정확히 도달했는지, 각 위성이 계획된 시점과 조건에 따라 정상적으로 분리됐는지를 정밀 분석하고 있다. 임무를 마친 누리호 3단은 분리된 위성과의 충돌과 궤도상 자발적 폭발을 막기 위해 남은 산화제와 헬륨 등 잔여가스를 배출하는 후속 조치도 마쳤다. ◆ 국내 첫 군집위성 발사…위성 5기 '다방향' 분리 이번 발사는 같은 임무를 수행하는 위성 여러 기를 한 번의 발사로 순차 투입한 국내 첫 군집위성 발사다. 누리호 상단은 위성끼리 부딪히지 않도록 자세를 제어하며 네온샛을 서로 다른 방향으로 내보냈다. 우주청에 따르면 2호와 3호, 5호와 6호 사이에는 60도, 3호와 4호, 4호와 5호 사이에는 30도씩 기울기를 바꿔가며 분리하도록 설계됐다. 큐브위성까지 모두 분리한 뒤에는 누리호 상단과 위성 간 충돌을 막기 위한 회피 기동을 수행한다. 누리호 5호기 3단에 장착이 완료된 초소형군집위성(네온샛) 2~6호 5기. [사진=우주항공청] 여러 위성을 연달아 내보내기 위해 탑재부 설계도 바꿨다. 기존 누리호의 소형 위성분리장치를 바탕으로 일체형 클램프 밴드 방식의 저충격 위성분리장치를 새로 개발해 처음 적용했고, 큐브위성을 싣기 위한 하부링도 새로 달았다. 위성부 무게는 네온샛 5기 약 500kg, 큐브위성 10기 약 96kg, 위성사출장치와 어댑터 약 475kg을 합쳐 약 1071kg이다. 차세대중형위성 3호를 실었던 4차 발사(약 960kg)보다 무거워졌다. 목표 고도는 4차 600km에서 이번에 570km로 낮아졌다. 네온샛은 한국과학기술원(KAIST) 인공위성연구소가 개발을 총괄한 100kg 미만 초소형 지구관측위성이다. 항우연이 지상·검보정·활용 시스템을, 쎄트렉아이가 위성 본체와 탑재체를 함께 개발했다. 흑백 1m급·컬러 4m급 해상도의 전자광학카메라로 촬영한 영상은 국가안보와 산불·홍수 등 재난·재해 대응에 쓰인다. 이번에 올린 5기는 1차 양산기다. 2027년 6차 발사에서 2차 양산기 5기(7~11호)가 더해지면 10기가 두 개의 궤도면에서 군집을 이룬다. 군집이 갖춰지면 한반도를 하루 3회 이상 촬영하고 같은 지점을 24시간 안에 다시 촬영할 수 있다. 10기를 운영하면 하루 약 70만㎢의 영상을 얻을 수 있다. 과학커뮤니케이터인 강성주 전 한국천문연구원 선임연구원은 한국과학기술미디어센터에 "이제 누리호의 성공 기준도 단순히 끝까지 비행에 성공해 위성을 궤도에 올려놓을 수 있는가에서, 실제 배치나 요구 조건이 더 까다로워진 위성 임무를 얼마나 정확하게 수행했는가로 넓어지고 있다고 본다"고 말했다. ◆ 민간 인력이 콘솔 잡았다…한화에어로 42명 투입 체계종합기업 한화에어로스페이스의 역할도 커졌다. 누리호 1~3호기는 항우연이 제작을 주관했지만, 4호기부터는 한화에어로스페이스가 제작을 주관하고 있다. 이번 5호기도 한화에어로스페이스가 제작을 총괄 주관했다. 발사운용 참여 범위도 넓어졌다. 이번 발사에서 한화에어로스페이스는 발사통제센터(LCC) 콘솔 22개 중 20개에 23명이 참여해 18명이 콘솔을 직접 운용했다. 임무지휘센터(MDC) 6명, 발사대(LP) 10명, 발사체 이송 안전 3명을 더하면 모두 42명이다. 4차 발사 때는 콘솔 조작을 항우연이 맡았고 한화에어로스페이스는 참여에 그쳤다. 이번에는 상당수 콘솔을 한화에어로스페이스 인력이 조작하고 항우연은 관리·감독을 맡았다. 발사운용 주관은 1~4차와 마찬가지로 항우연이 맡았다. 민간의 역할은 6차부터 더 커진다. 누리호 6호기부터는 한화에어로스페이스 단조립 공장에서 단 조립을 마친 뒤 바닷길로 나로우주센터에 옮겨 전체 조립을 한다. 6차 발사에서는 기술이전 대상인 발사통제센터 콘솔 거의 전부를 한화에어로스페이스가 운영할 예정이다. 한화에어로스페이스는 4~7차 발사운용에 참여하며, 고도화사업이 끝난 뒤 누리호 후속 발사를 민간 주도로 이어가기 위한 기술을 익히고 있다. ◆ 1차 실패 딛고 2~4차 성공…5차 위성 15기 사출 누리호는 2021년 10월 1차 발사에서 1.5톤급 위성모사체를 궤도에 올리지 못했다. 이듬해 6월 2차 발사에서는 성능검증위성과 1.3톤급 위성모사체를 궤도에 올리며 개발에 성공했다. 2023년 5월 3차 발사에서는 차세대소형위성 2호와 큐브위성 7기를, 2025년 11월 4차 발사에서는 차세대중형위성 3호와 큐브위성 12기를 실어 날랐다. 3차 발사부터는 반복 발사로 신뢰성을 높이고 기술을 민간에 이전하는 한국형발사체 고도화사업(2022~2028년, 사업비 7968억8000만원)으로 진행되고 있다. 2027년 6차 발사에는 네온샛 7~11호가, 2028년 7차 발사에는 차세대중형위성 5호가 주탑재위성으로 실릴 예정이다. 위성이 궤도에서 제대로 작동하는지는 지상국 교신으로 확인한다. 네온샛은 초기 운영 기간 대전 항우연 지상국이 주관제소를 맡고, 노르웨이 스발바르 지상국이 위성당 100회가량 관제를 지원한다. 남극 세종기지 지상국도 초기 운영에 활용된다. 정상 운영에 들어가면 제주 국가위성운영센터가 주관제소가 된다. 구체적인 비행 결과와 위성의 궤도 투입 결과는 정밀 분석이 끝나는 오후 2시께 프레스센터 상세 브리핑에서 발표된다. 네온샛 초기 교신 결과는 오후 4시30분께 공개할 예정이다. 큐브위성 10기의 교신 종합 결과는 13일께 발표한다. biggerthanseoul@newspim.com 2026-10-07 13:48
사진
새 주인 찾는 홈플러스, 희망퇴직 카드 꺼냈다 [서울=뉴스핌] 남라다 기자 = 홈플러스가 경영 정상화를 위한 인력 구조조정에 나섰다.  7일 유통업계에 따르면 홈플러스는 이날 마트노조 홈플러스지부와 홈플러스 일반노조에 희망퇴직 시행 관련 공문을 발송했다. 신청 기간은 이날부터 오는 22일까지다. 퇴직일은 이달 31일이며, 회사는 퇴직금을 다음달 14일까지 지급하겠다고 밝혔다. 홈플러스. [사진 = 뉴스핌DB] 홈플러스는 앞서 지난달 15일 각 노조와 만나 경영 상황을 설명하고 정상화 방안의 하나로 희망퇴직을 언급했다. 이번 희망퇴직은 매출 부진과 대형마트 사업 매각의 어려움이 이어지는 가운데 추진됐다. 홈플러스는 최근 매출이 당초 예상에 미치지 못하고, 대형마트 부문 매각 의향자 확보에도 난항을 겪는 것으로 알려졌다. 홈플러스 관계자는 "회생계획안 인가 이후 경영 정상화에 힘쓰고 있으며, 구조혁신을 통해 전반적인 영업환경을 안정시키는 데 집중하겠다"고 말했다.  nrd@newspim.com 2026-10-07 13:39
기사 번역
결과물 출력을 준비하고 있어요.
종목 추적기

S&P 500 기업 중 기사 내용이 영향을 줄 종목 추적

결과물 출력을 준비하고 있어요.

긍정 영향 종목

  • Lockheed Martin Corp. Industrials
    우크라이나 안보 지원 강화 기대감으로 방산 수요 증가 직접적. 미·러 긴장 완화 불확실성 속에서도 방위산업 매출 안정성 강화 예상됨.

부정 영향 종목

  • Caterpillar Inc. Industrials
    우크라이나 전쟁 장기화 시 건설 및 중장비 수요 불확실성 직접적. 글로벌 인프라 투자 지연으로 매출 성장 둔화 가능성 있음.
이 내용에 포함된 데이터와 의견은 뉴스핌 AI가 분석한 결과입니다. 정보 제공 목적으로만 작성되었으며, 특정 종목 매매를 권유하지 않습니다. 투자 판단 및 결과에 대한 책임은 투자자 본인에게 있습니다. 주식 투자는 원금 손실 가능성이 있으므로, 투자 전 충분한 조사와 전문가 상담을 권장합니다.
안다쇼핑
Top으로 이동