사전 학습 없이 바로 사용하는 AI
‘제로’는 지금 바로 쓸 수 있는 산업 특화 비전 파운데이션 모델입니다.
ZERO 2.2 업데이트
텍스트 프롬프트 검출 정확도 향상 — 미검출 감소
한국어·서술형 자연어 프롬프트 이해 개선 — “오렌지색 자켓”
신뢰도 스코어 구분 명확화 — 임계값 설정이 쉬워졌습니다

세계 최초 산업 특화 비전 파운데이션 모델 ‘제로’
CVPR 2026 퓨샷 객체 탐지 챌린지 1위!
현장 데이터 중심의 비전 AI 구축 노하우로, 세계 최대 컴퓨터 비전 학회 CVPR의 퓨샷 객체 탐지 챌린지에서 1위를 차지했습니다.
53.9mAP
2위 51.6 · 주최 측 베이스라인 33.3
5
7개 평가 카테고리 중 5개 1위
1위
2025년 4위에서 한 해 만에 1위
비전 AI 도입의 게임 체인저, ZERO
기존 비전 AI 도입 과정

1문제 정의
2데이터 수집
3데이터 라벨링
4모델 학습
5배포

바로 쓸 수 있는 ZERO

1문제 정의
2배포
| 제로(ZERO) | 기존 AI | 기존 SI | |
|---|---|---|---|
| 신규 요구 사항 즉시 반영 | 사전 학습한 것만 가능 | 개발 기간 2~6개월 | |
| 유연한 비즈니스 확장성 | 추가 개발 및 비용 발생 | ||
| 지속 가능, 효율적인 관리 | 여러 회사의 솔루션 도입, 관리 비용 증가 | 유지 보수 비용 발생 |
제로는 무엇이든 바로 이해합니다
텍스트 프롬프트
자연어 설명으로 원하는 객체를 정확히 찾아냅니다. 한국어 그대로 사용할 수 있습니다.
이미지 프롬프트
이미지 업로드 또는 박스·포인트 지정으로 직관적으로 객체를 탐지합니다.
제로는 이렇게 다릅니다

실시간 추론+압도적 성능
경량 모델 기준 0.329 TFLOPs(640×640)의 연산량으로 실시간 추론. 자체 산업 벤치마크에서 공개 모델 대비 최고 수준의 검출 정확도.
모델 라인업 보기
자유로운 자연어 설명
미리 정의된 클래스 없이 “창문 옆 빨간 의자” 같은 자연어 설명만으로 원하는 객체를 정확히 찾아냅니다.

지속적 성능 향상
자동화된 데이터 파이프라인을 통해 새로운 도메인과 시나리오에 대한 성능을 지속적으로 개선합니다.

유연한 배포
클라우드, 온프렘 모두 가능합니다. 다양한 하드웨어 환경(GPU, NPU, 엣지)에서 최적화된 성능을 이용하세요.

실시간 추론+압도적 성능
경량 모델 기준 0.329 TFLOPs(640×640)의 연산량으로 실시간 추론. 자체 산업 벤치마크에서 공개 모델 대비 최고 수준의 검출 정확도.
모델 라인업 보기
자유로운 자연어 설명
미리 정의된 클래스 없이 “창문 옆 빨간 의자” 같은 자연어 설명만으로 원하는 객체를 정확히 찾아냅니다.

지속적 성능 향상
자동화된 데이터 파이프라인을 통해 새로운 도메인과 시나리오에 대한 성능을 지속적으로 개선합니다.

유연한 배포
클라우드, 온프렘 모두 가능합니다. 다양한 하드웨어 환경(GPU, NPU, 엣지)에서 최적화된 성능을 이용하세요.
정확도부터 실시간까지,
용도에 맞게 선택하는 세 가지 크기
정확도가 최우선인 검사 환경부터 엣지 디바이스의 실시간 처리까지. 어떤 크기를 선택해도 텍스트·비주얼 프롬프트 방식은 동일합니다.
| 모델 | 배포 파라미터 | 추론 시 활성 파라미터 | 권장 용도 |
|---|---|---|---|
| ZERO-Tiny | 440M | 65M | 엣지 · 실시간 처리 |
| ZERO-Base | 500M | 125M | 범용 |
| ZERO-Large | 610M | 235M | 최고 정확도 |
경량 모델 ZERO-Tiny는 640×640 입력 기준 0.329 TFLOPs의 연산량으로 실시간 추론을 수행합니다. 상위 모델의 검출 성능을 거의 그대로 유지하면서 현장 운영 비용을 낮추도록 개발됐습니다.
실시간 모델에서도 검출 정확도는 2배 이상
SPBEval Text-G / Visual-G AP · 640×640 기준
| 모델 | 활성 파라미터 | 연산량 | Text AP | Visual AP |
|---|---|---|---|---|
| ZERO-Tiny | 65.0M | 0.329 TFLOPs | 29.7 | 23.7 |
| YOLOE-26x | 69.9M | 0.197 TFLOPs | 14.2 | 15.4 |
비슷한 규모의 실시간 검출 모델 대비 2배 이상의 검출 정확도. 프롬프트 캐싱으로 실시간 처리 속도를 유지합니다.
제로의 압도적인 성능을 확인하세요
자체 산업 도메인 벤치마크 SPBEval 기준. 최신 버전의 절대 성능과, 버전마다 이어지는 개선 추이를 함께 보여줍니다.
ZERO 2.2 vs 공개 모델
SPBEval Text AP · ZERO 2.2(Large) 기준
- ZERO 2.231.3
- LLMDet20.6
- Grounding DINO17.9
- Qwen3-VL16.2
- YOLOe13.8
- OWLv212.9
- DINO-X12.8
SPBEval — 슈퍼브에이아이 자체 산업 도메인 벤치마크 · Visual AP 차트 동일 구성 병행(ZERO 2.2 Visual-G 26.2 / Visual-I 56.3)
버전마다 이어지는 개선
SPBEval Text AP · 버전별 추이
질문이 있으신가요?
아래 항목에서 찾아보세요.
제로의 주요 성능 장점은 무엇인가요?
• 정확도 — 자체 산업 벤치마크(SPBEval)에서 공개 모델 대비 최고 수준의 검출 정확도 (ZERO 2.2 Text AP 31.3, 차순위 20.6)
• 연산 효율 — 경량 모델 기준 추론 시 활성 파라미터 65M · 0.329 TFLOPs(640×640)로 실시간 처리
• 확장성 — Tiny / Base / Large 세 가지 크기, 엣지부터 고정밀 검사까지 하나의 사용 방식
한국어 프롬프트를 지원하나요?
네. “치즈”, “컵라면” 같은 한국어 단어는 물론 “오렌지색 자켓”처럼 속성을 포함한 서술형 표현도 처리합니다.
AWS로 도입할 수 있나요?
네. ZERO 2.2는 AWS Marketplace에서 바로 사용할 수 있습니다. Amazon SageMaker 엔드포인트로 배포해 API로 호출하며, 이미 AWS를 운영 중이라면 별도 계약 절차 없이 기존 AWS 계정으로 도입할 수 있습니다.
제로와 기존 AI와 가장 큰 차이점은 무엇인가요?
VFM 제로는 별도의 모델 학습 과정 없이, 간단한 프롬프트(텍스트, 박스, 스케치 등 지시)만으로 즉시 원하는 객체나 상황을 탐지하고 분석할 수 있는 슈퍼브에이아이의 혁신적인 비전 파운데이션 모델입니다. 기존 비전 AI가 데이터 수집, 라벨링, 모델 학습, 배포까지 수개월이 걸렸던 복잡한 과정을 생략하여, 시간, 비용, 전문성의 장벽을 획기적으로 낮춘 것이 가장 큰 차이점입니다.
제로를 사용하려면 AI 전문 지식이나 데이터 라벨링 작업이 꼭 필요한가요?
아니요, VFM 제로는 AI 비전문가도 쉽게 사용할 수 있도록 설계되었습니다. 직관적인 프롬프트 방식을 사용하므로, 복잡한 코딩 지식이나 별도의 대규모 데이터 라벨링 작업 없이 바로 활용 가능합니다.
제로는 어떤 종류의 객체나 상황을 탐지할 수 있나요? 학습되지 않은 새로운 대상도 인식 가능한가요?
특정 카테고리에 국한되지 않고 사용자가 프롬프트를 통해 설명하는 거의 모든 종류의 객체, 행동, 상황을 탐지할 수 있습니다. 특히, 모델이 사전에 명시적으로 학습한 적 없는 새로운 대상이나 시나리오도 사용자의 설명만으로 인식하고 찾아내는 강력한 제로샷(Zero-Shot) 성능을 제공합니다.
제로를 실제 업무에 도입하는 데까지 얼마나 걸리고, 기존에 사용 중인 영상 장비와도 호환되나요?
제로의 가장 큰 장점 중 하나는 ‘즉시 적용’입니다. 별도의 모델 학습 기간이 필요 없으므로, 시스템 연동 및 프롬프트 정의 등의 준비가 완료되면 매우 짧은 시간 안에 실제 업무 활용을 시작할 수 있습니다. 또한, 제로가 적용된 슈퍼브 영상 관제 솔루션을 도입하면, 표준 프로토콜을 지원하는 대부분의 기존 CCTV, IP 카메라, 드론 등 다양한 영상 장비와 유연하게 연동됩니다.




