AI 핵심 요약
beta- 딥시크가 10일 V4.1 Flash를 공식 출시했다.
- KV Cache를 대폭 줄여 메모리와 저장장치 의존도를 낮췄다.
- API 가격을 인하하고 V4 Pro도 순차 종료한다.
!AI가 자동 생성한 요약으로 정확하지 않을 수 있어요.
이 기사는 9월 11일 오후 4시35분 '해외 주식 투자의 도우미' GAM(Global Asset Management)에 출고된 프리미엄 기사입니다. GAM에서 회원 가입을 하면 9000여 해외 종목의 프리미엄 기사를 보실 수 있습니다.
이 기사는 인공지능(AI) 번역을 바탕으로 전문 기자들의 검증과 분석을 거쳐 생산된 콘텐츠로, 원문은 중국 IT 전문 매체 테크웹(TECHWEB) 9월 10일자 기사입니다.
[서울=뉴스핌] 배상희 기자 = 중국 인공지능(AI) 스타트업 딥시크(DeepSeek∙深度求索∙선두추쒀)가 새로운 모델 '딥시크(DeepSeek) V4.1 플래시(Flash)'를 공식 출시했다. 특히 차세대 모델의 KV Cache(Key·Value Cache) 규모를 대폭 축소해 메모리와 저장장치에 대한 의존도를 크게 낮춘 것이 특징이다.
KV Cache는 AI가 앞서 처리한 정보를 임시로 저장해 재활용하는 메모리 기술로, 이를 줄이면 AI 추론 과정에서 필요한 메모리와 비용을 낮출 수 있다.
딥시크에 따르면 V4.1 Flash의 HBM(고대역폭 메모리) 수요는 이전 세대 모델의 4분의 1 수준으로, SSD(솔리드스테이트드라이브) 수요는 8분의 1 수준으로 감소했다. 이에 따라 AI 모델의 추론 과정에서 발생하는 메모리 및 저장장치 비용을 크게 낮출 수 있을 것으로 기대된다.
특히 에이전트(Agent) 활용 환경에서는 KV Cache 적중에 따른 비용 비중이 높은 만큼, KV Cache를 압축하면 에이전트 작업의 이용 비용을 크게 낮출 수 있다고 딥시크는 설명했다. 회사에 따르면 딥시크의 KV Cache 규모는 초기 모델과 비교해 437분의 1 수준까지 축소됐다.
◆ 552B MoE 구조…입·출력 비대칭으로 비용 절감
V4.1 Flash는 딥시크가 새롭게 설계한 모델 구조 가운데 가장 작은 버전으로, 네이티브 멀티모달 시각 이해 기능을 지원한다.
모델에는 552B(5520억) 파라미터 규모의 MoE(Mixture of Experts) 구조와 새로운 Causal-Encoder-Decoder 구조가 적용됐다.
입력과 출력의 활성화 파라미터 규모도 비대칭적으로 설계했다. 입력 활성화 규모는 8B(80억), 출력 활성화 규모는 16B(160억)로, 동일한 규모의 모델과 비교해 비용을 낮추는 데 초점을 맞췄다.
딥시크는 새로운 사전학습 방식과 대규모 강화학습 후학습을 적용했으며, 벤치마크 테스트에서 DeepSeek V4 Pro를 비롯한 여러 플래그십 모델을 능가하는 성능을 기록했다고 밝혔다.

◆ V4 Pro 순차 종료…API 가격도 인하
V4.1 Flash는 딥시크 API에 동시에 출시됐으며 네이티브 멀티모달 기능을 지원한다. 사용자는 모델명을 deepseek-flash로 변경해 호출할 수 있다.
기존 V4 Flash와 V4 Flash Vision Exp 모델은 이미 서비스가 종료됐다. 호환성을 위해 deepseek-v4-flash와 deepseek-v4-flash-vision-exp 모델명은 당분간 V4.1 Flash로 연결된다.
딥시크는 여러 차례 테스트를 통해 V4.1 Flash가 성능·비용·속도·전체 작업시간 등에서 V4 Pro를 종합적으로 앞섰다고 밝혔다. 이에 따라 V4 Pro도 순차적으로 종료할 계획이다.
2026년 9월 14일 낮 12시(이하 베이징 현지 시간) 이후부터 차세대 V4.1 Pro가 출시되기 전까지 deepseek-v4-pro에 대한 요청은 모두 V4.1 Flash로 연결되며, V4.1 Flash 가격이 적용된다.
◆ 추론 비용 낮추고 사용량 확대…차등 요금제 유지
딥시크는 새로운 모델 구조를 통해 더 낮은 비용으로 더 많은 사용자를 지원할 수 있게 됐다고 설명했다. 이에 따라 V4.1 Flash의 API 가격도 기존보다 인하했다.
자원 활용을 효율적으로 배분하기 위해 피크·비피크 차등 요금제는 유지한다. 비피크 시간대 가격은 피크 시간대의 절반으로 책정해 사용자가 실제 이용 상황에 따라 작업 시간을 조정하도록 유도한다.
새로운 가격은 2026년 9월 10일 낮 12시부터 적용됐다.
딥시크는 오픈소스 커뮤니티가 새로운 모델을 추론 환경에 적용할 수 있도록 적극 지원하는 한편, 다양한 방식을 통해 V4.1 Flash의 배포 범위를 확대할 계획이라고 밝혔다.
pxx17@newspim.com













