제논, 컴퓨터 조작 AI '훈민 VLM 397B' 오픈소스 공개
3,970억 파라미터 모델 기반, 화면 인식과 실행 능력 강화

한눈에 보기
- 이 모델은 단순한 질문 응답을 넘어서 OSWorld에서 70.5점, ScreenSpot-Pro에서 75.6점의 성과를 기록하며, 실제 업무 수행 능력에서 높은 수준의 성능을 입증했다.
- 이는 고난도 화면 인식과 다단계 과업 수행이 가능함을 의미하며, 특히 리눅스 환경에서 360개 과제를 성공적으로 수행한 점에서 실용성과 신뢰성을 입증했다.
- 제논은 이 모델의 개발 과정을 전면 공개했으며, FP8 양자화 기술을 활용해 원본 모델 용량을 절반으로 줄인 버전도 함께 제공했다. 이는 메모리 사용량을 줄이며 오픈소스 생태계에서의 활용성을 높인 것으로, B200 GPU 8대를 사용한 후학습 과정에서도 자원 효율성을 극대화했다.
생성형 AI 솔루션 전문기업 제논(대표 고석태)은 컴퓨터 화면을 인식하고 직접 조작해 업무를 수행할 수 있는 AI 모델 ‘훈민 VLM 397B(Hunmin VLM 397B)’를 오픈소스로 공개했다고 18일 밝혔다. 이 모델은 3,970억 개 파라미터 규모의 공개 모델 ‘큐웬(Qwen)3.5-397B’를 기반으로 개발됐다. 제논은 지난해 ‘훈민 32B’와 올해 초 ‘훈민 VLM 235B’를 선보인 바 있으며, 이번 모델은 범용 AI 모델의 기존 능력을 최대한 유지하면서 실제 업무에 필요한 새로운 능력을 추가하는 방식으로 훈민 시리즈를 고도화한 결과물이다.
훈민 VLM 397B의 핵심 능력은 화면 속 버튼이나 입력창 등 사용자가 조작해야 할 대상을 찾아내는 ‘그라운딩(Grounding)’부터 실제 컴퓨터 환경에서 주어진 과업을 수행하는 단계까지 전반적인 컴퓨터 사용 능력을 강화하는 것이다. 이는 최근 AI 업계에서 확산되고 있는 ‘컴퓨터 유즈(Computer Use)’와 ‘액셔너블 AI(Actionable AI)’의 핵심 기술로, 단순히 질문에 답하는 수준을 넘어 실제 작업을 수행하는 실행형 AI의 발전을 의미한다.
특히 고난도 화면 인식 성능을 평가하는 ‘ScreenSpot-Pro’에서 75.6점의 성적을 기록하며 허깅페이스 공식 리더보드 2위에 올랐다. 제논은 현재 리더보드에 등록된 48개 모델 가운데 국내 기업이 개발한 모델은 훈민 VLM 397B가 유일하다고 밝혔다. 리눅스 데스크톱 환경에서 360개 과제를 수행하는 ‘OSWorld’에서는 70.5점을 기록했으며, 이는 기본 모델보다 22.3점 높은 수치다. 윈도우 환경에서 AI 에이전트의 컴퓨터 사용 능력을 평가하는 ‘WindowsAgentArena’에서도 기본 모델보다 9.1점 향상된 성능을 보였다.
훈민 VLM 397B는 KMMLU와 K-MMBench 등 8개 한국어 벤치마크에서 기본 모델 대비 2점 이내의 성능을 유지했다. 제논은 동일한 기본 모델에 컴퓨터 조작 능력을 추가한 비교 모델이 일부 벤치마크에서 최대 6점 하락한 것과 비교해, 실행 능력을 강화하면서도 한국어 기반 기업 환경에서 활용할 수 있는 언어 능력을 유지했다고 설명했다. 개발 방법론은 원본 모델과 FP8 양자화 상태에서 지도학습(SFT)과 강화학습(RL)을 진행한 후, 저랭크 방식으로 능력을 이식한 방식이다.
훈민 VLM 397B는 단순한 화면 객체 인식을 넘어서 운영체제와 애플리케이션 간 전환을 포함한 다단계 과업 수행 능력을 갖췄다. 이는 사용자가 지시한 작업을 단계별로 분해하고, 화면 상태를 지속적으로 인식하며 실행하는 능력을 의미한다.
제논은 후학습 과정에서 FP8 형식으로 메모리 사용량을 절감한 상태에서 지도학습(SFT)과 강화학습(RL)을 수행했다. 전체 후학습에는 B200 GPU 8대를 사용했으며, 이는 대규모 모델에 실행 능력을 추가하는 데 있어 자원 효율성을 극대화한 사례다. 비교 모델의 성능을 동일한 환경과 평가 조건에서 재평가한 절차와 설정도 문서로 공개했다.
제논은 훈민 VLM 397B의 원본 모델과 FP8 버전을 Apache 2.0 라이선스로 공개했다. FP8 버전은 원본 모델의 용량을 절반 수준으로 줄였으며, 오픈소스 생태계에서의 활용성을 높였다. 비교 모델의 재평가 조건과 방법론도 동일한 형식으로 공개해 연구자들이 정확한 성능 비교를 수행할 수 있도록 했다.
명대우 제논 부사장(CTO)은 훈민 VLM 397B가 단순한 파라미터 확장이 아닌, 제한된 자원으로도 실행 능력을 효율적으로 추가하고 기존 언어 성능을 유지한 결과물이라고 평가했다. 그는 AI 모델 경쟁의 중심이 파라미터 규모에서 실제 활용 가능한 실행 능력의 고도화로 이동하고 있다고 설명했다.
제논은 앞서 지난 7월 7,430억 파라미터 규모의 모델을 소규모 GPU 환경에서 학습하는 방법을 기술 보고서로 공개한 바 있다. 이번에는 해당 방법론을 실제 모델 개발에 적용해 제한된 컴퓨팅 자원으로 초거대 모델에 새로운 능력을 추가할 수 있는 후학습 역량을 구현했다. 제논은 이번에 훈민 VLM 397B와 함께 개발 및 평가 방법론도 전면 공개했다. 이는 훈민 시리즈를 통해 액셔너블 AI의 기반 기술을 지속적으로 고도화하는 한편, 개발 과정과 방법론을 적극적으로 공유해 오픈소스 AI 생태계 발전에도 기여하겠다는 전략의 일환이다.
한국 독자를 위한 맥락
제논이 공개한 '훈민 VLM 397B'는 단순한 파라미터 수 증가가 아니라, 실제 업무 환경에서 컴퓨터를 조작할 수 있는 능력을 추가한 실행형 AI의 대표 사례다. 이 모델은 화면 속 요소를 인식하고, 버튼을 클릭하거나 입력창에 글을 쓰는 등 실제 작업을 수행하는 능력을 갖추고 있으며, 이는 최근 AI 업계에서 주목받는 '컴퓨터 유즈'와 '액셔너블 AI'의 핵심 기술을 구현한 결과다. 기존 AI는 질문에 답하는 데 그쳤지만, 훈민 VLM 397B는 지시에 따라 단계별로 작업을 분해하고 화면 상태를 지속적으로 인식해 실행하는 능력을 보유하고 있다.
이 모델의 성능은 여러 벤치마크에서 검증됐다. 또 'ScreenSpot-Pro'에서 75.6점으로 허깅페이스 공식 리더보드 2위에 올랐으며, 윈도우 환경에서의 'WindowsAgentArena'에서도 기본 모델보다 9.1점 향상된 성과를 냈다.
특히 주목할 점은, 이 모델이 기존 언어 능력을 크게 훼손하지 않고 새로운 능력을 추가했다는 점이다. 이는 한국어 기반 기업 환경에서의 실제 활용 가능성을 높이는 중요한 요소다. 즉, 한국 사용자가 주로 쓰는 언어로 지시를 내려도, AI가 그 의미를 정확히 이해하면서 동시에 컴퓨터를 조작할 수 있다는 뜻이다.
개발 과정에서도 자원 효율성과 재현성을 중시했다. FP8 형식을 적용해 메모리 사용량을 줄인 것은, 고성능 모델을 소규모 GPU 환경에서도 활용할 수 있도록 하는 핵심 전략이었다. 이는 대규모 모델에 새로운 능력을 추가하는 데 있어 자원 낭비를 줄이고, 연구자들이 동일한 조건에서 성능을 재평가할 수 있도록 하는 기반을 마련했다.
제논은 이번 공개를 통해 단순한 모델 배포를 넘어서, 개발 방법론과 평가 조건까지 전면 공개했다. 이는 오픈소스 생태계의 발전을 위해 기술을 투명하게 공유하려는 전략의 일환이며, 특히 국내 기업이 개발한 모델이 허깅페이스 리더보드에 단독으로 등재된 점에서 의미가 크다. 국내 기업이 개발한 모델이 48개 모델 중 유일하게 리더보드에 오른 것은, 국내 AI 기술의 경쟁력이 글로벌 수준에 도달했음을 보여주는 신호다.
이번에는 이를 통해 초거대 모델에 새로운 능력을 추가하는 후학습 역량을 구현했으며, 이는 파라미터 규모에 의존하지 않고도 실행 능력을 고도화할 수 있음을 보여준다. 이는 AI 경쟁의 중심이 파라미터 수에서 실제 작업 수행 능력으로 이동하고 있음을 시사하며, 제논은 이를 통해 액셔너블 AI의 기반 기술을 지속적으로 고도화하고 있다.
결국 훈민 VLM 397B는 단순한 기술 발전을 넘어서, 한국어 환경에서의 실용성과 오픈소스 생태계의 발전을 동시에 고려한 전략적 제품이다. 기존 언어 능력을 유지하면서도 컴퓨터 조작 능력을 강화한 점, FP8 양자화를 통해 자원 효율성을 극대화한 점, 그리고 개발 방법론까지 공개한 점은, 단기적인 성능 향상이 아니라 장기적인 기술 생태계 구축을 목표로 한 행보다. 이는 AI가 단순한 도구가 아니라, 실제 업무를 대신할 수 있는 파트너로 진화하고 있음을 보여주는 중요한 사례다.