Загружаем каталог…
Загружаем каталог…
(출처: arXiv:2609.36136, Figure 1) Xiaomi-OCR-0 Technical Report 저자: Xin Chen, Anan Du, Feng Feng, Pei Fu, Jian Luan, Longwei Xu, Shaojie Zhang, Hang Li, Heng Qu, Cheng Tan (SeerRay Team) 공개일: 2026년 9월 28일 (arXiv v1, cs.CV) arXiv: https://arxiv.org/abs/2609.36136 코드: https://github.com/SeerRay-Lab/Xiaomi-OCR-0 모델: https://huggingface.co/SeerRay-Lab/Xiaomi-OCR-0 (Apache-2.0) 데모: https://huggingface.co/spaces/SeerRay-Lab/Xiaomi-OCR-0 분류: OCR Document Parsing Vision-Language Model Reinforcement Learning 🔖 TL;DR (한눈에) 0.8B 파라미터 단일 모델 로 문서 파싱(레이아웃·텍스트·표·수식 구조화)과 OCR 기반 이해(VQA·핵심정보추출)를 함께 처리한다. 베이스는 Qwen3.5-0.8B-Base. 핵심은 모델이 아니라 데이터 엔진 이다. 8개 전문 OCR 모델의 합의(consensus)로 라벨을 만들고, 합의가 낮은 샘플은 라벨을 다시 이미지로 렌더링해 원본과 눈으로 비교 하는 방식으로 교정해 약 1억 7천만 샘플을 자동 구축했다. 학습은 3단계다. 텍스트를 쓰면서 그 위치까지 같이 맞추게 하는 Q-Mask 텍스트 앵커링 → 지속 사전학습(CPT) → 파싱과 이해를 섞어 돌리는 Mix-RL (검증 가능한 보상 기반 강화학습). OmniDocBench v1.6 96.83 , Real5-OmniDocBench 95.24 , Wild-OmniDocBench 87.94 . OCR VQA 5종 평균 83.2 로, 같은 0.8B 베이스 모델(72.9)보다 +10.3, 8B급 MiniCPM-V-4.5(82.6)보다도 높다. 흥미로운 발견: 이해(understanding) 데이터는 파싱 실력이 어느 정도 올라온 뒤에야 파싱에 도움이 된다. 학습 초기에 섞으면 오히려 파싱 점수가 떨어진다(-0.330). 한 줄 요약 : 0.8B라는 작은 몸집으로 문서 파싱과 문서 이해를 동시에 잡아낸 기술 보고서이며, 그 비결은 "렌더링해서 눈으로 검증하는" 자동 데이터 엔진과 파싱·이해를 함께 돌리는 혼합 강화학습이다. 📄 초록(Abstract) 완역 소형 OCR 전용 비전-언어 모델(VLM)은 강력한 문서 파싱 성능을 보이지만, 값비싼 지도(supervision)에 의존하고 주로 시각-텍스트 재구성에만 초점을 맞추는 경우가 많다. 우리는 문서 파싱과 OCR 중심 이해를 위한 통합 0.8B 모델 Xiaomi-OCR-0를 제안한다. 우리는 전문가 합의(expert consensus), 렌더링 기반 검증(render-based verification), 표적 합성(targeted synthesis)을 결합한 자동 데이터 엔진을 사용해 약 1억 7천만 샘플 규모의 OCR 중심 코퍼스를 구축한다. Qwen3.5-0.8B에서 출발하여, 우리의 점진적 학습 레시피는 Q-Mask 기반 텍스트 앵커링, 지속 사전학습, 그리고 혼합 과제 강화학습(Mix-RL)을 결합한다. Xiaomi-OCR-0는 Real5-OmniDocBench에서 95.24, OmniDocBench v1.6에서 96.83, Wild-OmniDocBench에서 87.94를 달성하며, 5종의 OCR 중심 VQA 벤치마크에서 평균 83.2점에 도달한다. 또한 어블레이션 실험은 파싱 학습이 충분히 이루어진 뒤에는 OCR 중심 이해 지도가 문서 파싱에도 추가적인 이득을 제공함을 보여준다. 초록이 말하는 바는 세 가지다. 첫째, 기존 소형 OCR 모델들은 "이미지의 글자를 다시 텍스트로 옮기는" 재구성 과제에 최적화되어 있고 그 라벨을 얻는 비용이 크다. 둘째, 이 논문은 사람의 라벨링 대신 여러 전문 모델의 합의와 렌더링 기반 자동 검증으로 대규모 코퍼스를 만들고, 위치 정보까지 함께 학습시키는 3단계 레시피로 0.8B 모델을 끌어올렸다. 셋째, 파싱과 이해를 섞어 학습하는 것이 늘 좋은 것은 아니며 순서와 타이밍이 중요하다 는 실험적 관찰을 덧붙인다. 🧩 왜 이 문제가 중요한가 문서를 다루는 실무에서 필요한 작업은 보통 두 갈래로 나뉜다. 하나는 파싱 이다. PDF나 스캔 이미지를 받아 제목·본문·표·수식·읽기 순서를 구조화된 마크업으로 복원하는 일로, RAG 파이프라인의 전처리 단계가 대표적이다. 다른 하나는 이해 다. "이 영수증의 총액은 얼마인가", "이 차트에서 가장 높은 막대는 어느 분기인가"처럼 문서를 읽고 질문에 답하거나 필드를 뽑아내는 일이다. 문제는 이 둘이 보통 다른 모델로 운영된다는 점이다. 파싱은 OCR 전용 소형 모델이, 이해는 범용 VLM이 맡는다. 모델 두 벌을 서빙해야 하고, 파싱 결과가 틀리면 이해 단계가 그 오류를 그대로 물려받는다. 하나의 작은 모델이 두 일을 모두 해내면 서빙 비용과 오류 전파가 동시에 줄어든다. 그런데 통합은 쉽지 않다. 파싱은 이미지를 빠짐없이 글자 단위로 옮기는 정밀한 전사 능력을 요구하고, 이해는 맥락을 잡아 추론하는 의미 파악 능력을 요구한다. 작은 모델에서 두 능력은 제한된 파라미터를 두고 경쟁한다. 게다가 파싱 학습에 필요한 고품질 라벨(표 구조, 수식 LaTeX, 읽기 순서)은 사람이 달기에 가장 비싼 종류의 라벨이다. 이 논문은 라벨 비용 과 능력 경쟁 두 문제를 각각 데이터 엔진과 학습 레시피로 공격한다. 🔬 방법론 1. 데이터 엔진: 합의하고, 렌더링해서 확인하고, 모자란 곳을 합성한다 (출처: arXiv:2609.36136, Figure 2) 약 1억 7천만 샘플의 코퍼스는 모두 이미지 - 지시문 - 응답 형식으로 통일되어 있고, 텍스트·표·수식을 잘라낸 영역 단위(region-level) 샘플과 전체 문서를 다루는 페이지 단위(page-level) 샘플로 구성된다. 이 코퍼스를 만드는 장치가 세 부분이다. (a) 앙상블 삼중 합의 (Ensemble Triplet Consensus) 서로 계보가 다른 8개의 공개 OCR 전문 모델 — PaddleOCR-VL-1.6, MinerU2.5-Pro, GLM-OCR, dots.ocr, HunyuanOCR-1.5, TeleOCR, OvisOCR2, Qianfan-OCR — 이 같은 영역을 각자 읽는다. 그 다음 절차는 이렇다. 각 전문가 $i$의 평균 일치도를 구한다: $C_i = \frac{1}{N-1}\sum_{j \neq i} S(y_i, y_j)$ 점수가 높은 상위 3개 전문가 만 골라 삼중 조합 $T^*$를 만든다 그 삼중 조합 내부의 일치도 $a(x)$를 계산한다 최종 의사 라벨은 삼중 조합의 메도이드 , 즉 나머지 둘과 가장 많이 일치하는 예측으로 정한다 여기서 유사도 $S$는 모달리티마다 다르게 쓴다. 텍스트는 $1-\text{NED}$(정규화 편집거리의 보수), 표는 TEDS, 수식은 CDM이다. 직관은 단순하다. 서로 다른 구조의 모델 여러 개가 같은 답을 내놓으면 그 답은 믿을 만하고, 제각각이면 그 영역은 어렵다는 신호다. 그래서 일치도 구간별로 처리를 갈라 놓는다: 0.9 이상은 그대로 채택 , 0.6~0.9는 렌더링 기반 교정으로 보냄 , 0.6 미만은 교정 또는 사람 검수 . (b) 렌더링 기반 교정-판정 (Render-Guided Refine-and-Judge) 이 논문에서 가장 재미있는 장치다. 교정 담당은 전문가 풀에 의도적으로 포함시키지 않은 별도의 큰 모델 Qwen3.5-122B다. 상위 2개 전문가의 예측을 초기값으로 받아 최대 3라운드 동안 다음을 반복한다. 현재 후보 라벨 $\hat{y}^{(t)}$를 다시 이미지로 렌더링 해($r^{(t)} = R(\hat{y}^{(t)})$) 원본 이미지 조각과 나란히 놓고 비교한 뒤, 수정 제안 $\delta^{(t)}$를 받는다. 렌더링 대상 포맷은 텍스트와 표는 HTML, 수식은 LaTeX다. 3라운드로도 결론이 안 나면, 그간의 검증 기록 $H$ 전체를 보여주고 "반복적으로 틀리는 지점이 무엇인가"를 묻는 2차 비평 단계로 넘긴다. 교정된 후보는 다시 전문가 풀로 돌아가 재합의를 거치고 , 거기서 높은 일치도를 받은 것만 최종 코퍼스에 들어간다. 왜 렌더링인가. 표의 셀 병합이 틀렸거나 수식의 괄호 범위가 어긋난 오류는 HTML/LaTeX 문자열만 들여다봐서는 잡기 어렵지만, 그려서 원본과 겹쳐 보면 눈에 띈다 . 사람이 조판 교정을 볼 때 하는 일을 그대로 자동화한 셈이다. (c) 다요인 샘플 마이닝과 표적 합성 샘플마다 세 가지 신호를 기록한다. 전문가 일치도 $a_i$, 모델이 같은 입력을 여러 번 풀었을 때의 자기 일관성 $u_i$, 그리고 Qwen3-VL-Embedding 특징을 K-Means로 묶은 의미 클러스터 $k(i)$다. 샘플링 확률은 $$P(i|k) \propto (a_i + \epsilon)^{f_a/\tau} \cdot (1 - u_i + \epsilon)^{f_u/\tau}$$ 로 두어, 라벨은 믿을 만하지만($a_i$ 높음) 모델이 흔들리는($u_i$ 낮은 일관성) 구간을 하드 샘플 로 집중 수집한다. 학습/검증 분할은 출처 문서 단위 로 나누고, 검증 분할은 합성 데이터의 입력에서 완전히 배제해 누수를 막았다 — 기술 보고서치고 꼼꼼한 부분이다. 합성은 두 방향이다. 커버리지 기반 합성 은 샘플이 적은 클러스터를 겨냥해 긴 표, 복잡한 헤더, 병합 셀 템플릿과 저자원 문자·폰트·배경을 변형해 채운다. 실패 기반 합성 은 하드 검증셋에서 실제로 틀린 사례를 진단하고, 그 난이도를 유지한 채 템플릿·폰트·레이아웃·열화 조건만 바꿔 증식한다. 그렇게 만든 합성 데이터를 기존 학습 데이터에 섞어 고정된 하드 검증셋 으로 재평가한 뒤, 효과가 있을 때만 레시피를 채택한다. 2. 점진적 학습 레시피 (출처: arXiv:2609.36136, Figure 3) 1단계 — Q-Mask 텍스트 앵커링. VLM 위에 질의 조건부 마스크 디코더 를 하나 더 얹어, 모델이 텍스트를 토큰으로 생성하는 동시에 그 텍스트가 이미지의 어디에 있는지를 가리키는 마스크 까지 예측하게 한다. 손실은 $$\mathcal{L} {SSA} = \lambda {txt} \cdot \mathcal{L} {NTP} + \lambda {seg} \cdot (\mathcal{L} {Dice} + \mathcal{L} {CE})$$ 로, 일반적인 다음 토큰 예측 손실에 마스크에 대한 Dice 손실과 픽셀별 교차엔트로피가 더해진다. 효과는 분명하다. 글자를 받아쓰면서 그 위치를 함께 짚어야 하므로, 전체 페이지 파싱을 배우기 전에 내용과 좌표 사이의 정렬이 먼저 몸에 익는다. 이 단계에는 TextAnchor-26M과, 기존 문서 파싱 샘플을 같은 Q-Mask 형식으로 변환한 데이터를 쓴다. 2단계 — 지속 사전학습(CPT). 마스크 디코더는 떼어내고 비전-언어 백본만 이어받는다. 손실은 다음 토큰 예측에 베이스 모델이 이미 갖고 있는 다중 토큰 예측(MTP) 헤드 를 함께 학습시키는 항을 더한 형태다. $$\mathcal{L} {CPT}(\theta) = -\mathbb{E}\Big[\sum_t \log \pi_\theta(y_t \mid y {<t}, I, c)\Big] + \lambda_{MTP}\mathcal{L}_{MTP}(\theta)$$ 코퍼스는 문서 파싱을 주축으로 하되 OCR 기반 이해, OCR 캡셔닝, 장면 텍스트·손글씨·서예, 그리고 화학식·차트 같은 롱테일 과제를 섞는다. 모델 카드 기준으로 이 단계는 파싱 데이터의 9% → 29% → 50%를 쓰는 3개 하위 단계로 나뉘며, 뒤에 나오는 "초기/중기/후기" 전이 분석이 바로 이 구간에 대응한다. 3단계 — Mix-RL. GRPO 위에 DAPO 계열 의 기법을 얹은 정책 최적화다. 토큰 단위 손실 집계, clip-higher, 동적 샘플링을 쓰고, 참조 정책에 대한 명시적 KL 페널티는 두지 않는다 . 보상 분산이 0인 롤아웃 그룹은 버린다. $$\mathcal{L} {GRPO}(\theta) = \mathbb{E}\Big[\frac{1}{\sum_i |o_i|}\sum_i \sum_t \min\big(r {i,t}(\theta)\hat{A} i,\ \text{clip}(r {i,t}(\theta), 1-\epsilon_{low}, 1+\epsilon_{high})\hat{A}_i\big)\Big]$$ 이름의 "Mix"는 문서 파싱(텍스트·표·수식·전체 페이지)과 OCR 이해(VQA·KIE)를 한 번에 섞어 돌린다 는 뜻이다. 보상은 전부 검증 가능한 규칙 기반 이고 학습된 리워드 모델을 쓰지 않는다. 과제 보상 신호 텍스트 파싱 편집 유사도(edit similarity) 표 파싱 TEDS 수식 파싱 CDM 전체 페이지 파싱 $R_{doc} = w_{text}s_{text} + w_{table}s_{table} + w_{formula}s_{formula}$ (가중치는 정답 내 문자 비중) VQA ANLS KIE JSON 유효성 → 필드 매칭 → 필드 값의 정규화 편집 유사도 (누락 필드는 0점) 파싱 불가·형식 오류·길이 초과 출력은 일괄 0점 이다. RL 프롬프트는 2절의 하드 샘플 마이닝 결과를 다시 필터링하고 더 큰 언어모델과 사람이 검수해 만들었다. 비교군으로 등장하는 MOPD 는 multi-teacher on-policy distillation, 즉 파싱 교사와 이해 교사(각 4B) 두 명을 두고 증류하는 방식이다. 저자들은 Mix-RL을 이 MOPD와 나란히 놓고 비교한다. 📊 실험 결과 문서 파싱 모델 크기 OmniDocBench v1.6 ↑ Real5 ↑ Wild ↑ Xiaomi-OCR-0 0.8B 96.83 95.24 87.94 TeleOCR 1.2B 96.87 — 88.53 OvisOCR2 0.8B 96.58 92.29 87.91 PaddleOCR-VL-1.6 0.9B 96.33 93.19 87.36 MinerU2.5-Pro 1.2B 95.75 88.94 87.33 GLM-OCR 0.9B 95.22 90.32 85.08 표를 과장 없이 읽으면 이렇다. 표준 벤치마크인 OmniDocBench v1.6(96.83)과 야외 문서인 Wild(87.94)에서는 1.2B인 TeleOCR이 각각 96.87, 88.53으로 오히려 앞선다. Xiaomi-OCR-0의 분명한 우위는 Real5-OmniDocBench의 95.24 로, 차순위 PaddleOCR-VL-1.6(93.19)보다 +2.05 다. Real5는 촬영·재스캔 같은 실제 획득 조건에서의 강건성을 보는 벤치마크이므로, 이 격차가 가장 실무적인 의미를 갖는 숫자다. 즉 "모든 지표 1위"가 아니라 0.8B라는 크기에서 획득 강건성을 크게 끌어올린 모델 로 보는 편이 정확하다. 한편 논문의 Table 1은 소형 OCR 전용 모델뿐 아니라 범용 대형 VLM도 비교군에 올려두는데, 확인된 행만 보면 Ovis2.6-30B-A3B가 93.70, Gemini 3 Pro가 92.91이다. 문서 파싱이라는 좁은 과제에서는 0.8B가 30B급과 프런티어 API 모델을 앞설 수 있다 는 익숙한 그림이 여기서도 반복된다. OCR 기반 이해 (VQA 5종) 모델 크기 DocVQA InfoVQA ChartQA OCRBench TextVQA 평균 Xiaomi-OCR-0 0.8B 93.1 75.1 84.6 84.6 78.6 83.2 Qwen3.5-0.8B 0.8B 88.5 60.3 69.5 77.9 68.3 72.9 Qwen3.5-2B 2B 92.4 72.4 77.0 85.9 76.9 80.9 Qwen3.5-4B 4B 94.4 80.4 82.4 86.6 80.8 84.9 MiniCPM-V-4.5 8B 84.9 69.6 87.4 89.0 82.2 82.6 여기가 이 논문의 가장 설득력 있는 구간이다. 같은 베이스인 Qwen3.5-0.8B의 평균 72.9에서 83.2로 +10.3 이 올랐고, 2.5배 큰 Qwen3.5-2B(80.9)와 10배 큰 MiniCPM-V-4.5(82.6)를 모두 넘었다. 4B 모델(84.9)에는 1.7점 뒤지지만 파라미터는 1/5이다. 벤치마크별로는 DocVQA가 93.1로 가장 강하고, ChartQA·OCRBench·TextVQA에서는 8B 모델이 여전히 우위다. 문서 중심 과제에 특화된 향상이라는 뜻이다. 어블레이션: CPT → MOPD → Mix-RL 파싱(OmniDocBench v1.6): 설정 Overall ↑ Text Edit ↓ Formula CDM ↑ Table TEDS ↑ Table TEDS-S ↑ Reading Order Edit ↓ 4B 파싱 교사 96.9745 0.0308 98.4102 95.5932 97.5050 0.1228 0.8B CPT 96.4739 0.0332 98.3444 94.3973 96.6835 0.1221 0.8B MOPD 96.7417 0.0314 98.4677 94.8975 97.1579 0.1223 0.8B Mix-RL 96.8277 0.0313 98.5044 95.1087 97.1929 0.1221 이해(VQA 5종): 설정 Overall ↑ DocVQA InfoVQA ChartQA OCRBench TextVQA 4B VQA 교사 88.1 95.9 84.4 87.1 88.3 84.8 0.8B CPT 78.1 92.2 72.5 83.4 80.6 62.0 0.8B MOPD 82.7 93.1 74.8 84.2 83.9 77.5 0.8B Mix-RL 83.2 93.1 75.1 84.6 84.6 78.6 0.8B Mix-RL 행의 96.8277이 초록의 96.83과 맞아떨어진다. 즉 출시된 Xiaomi-OCR-0가 곧 0.8B Mix-RL 설정 이다. 두 표에서 읽히는 것은 세 가지다. 첫째, 파싱에서 Mix-RL은 CPT(96.47) → MOPD(96.74) → Mix-RL(96.83)로 올라가며 4B 교사(96.97)와의 격차를 0.15로 좁힌다. 파싱은 작은 모델로도 교사를 거의 따라잡을 수 있는 과제라는 뜻이다. 둘째, 이해에서는 78.1 → 82.7 → 83.2로 +5.1 이 오르는데, 특히 TextVQA가 62.0 → 77.5 → 78.6으로 +16.6 이라는 가장 큰 폭의 개선을 보인다. 다만 4B 교사(88.1)와는 여전히 4.9점 차이가 남는다. 셋째, 그래서 저자들의 결론이 나온다. 파싱은 0.8B로 충분하지만 이해는 파라미터를 더 요구한다. 0.8B → 4B로 키우면 VQA는 약 4.9점 오르는데 파싱은 0.15점밖에 오르지 않는다. 전이의 타이밍 가장 인용할 만한 분석 결과는 이해 데이터를 언제 섞느냐에 따라 파싱 점수의 변화 방향이 바뀐다는 것이다. 이해 지도를 추가한 시점 파싱 점수 변화 CPT 초기 -0.330 CPT 중기 +0.639 CPT 후기 +0.0749 초기에는 해가 되고, 중기에 가장 크게 도움이 되고, 후기에는 효과가 작아진다. 멀티태스크 학습을 "데이터를 다 섞으면 좋다"로 접근하는 관행에 대한 구체적인 반례다. 학습 동역학 측면에서는 MOPD가 더 적은 연산으로 빠르게 수렴하는 반면, Mix-RL은 학습을 길게 가져갈 때 두 능력 모두에서 더 높은 정점에 도달한다고 보고한다. 🚧 한계 이 논문은 산업계 기술 보고서 형식이라 독립된 "Limitations" 절을 두지 않는다. 아래는 본문 분석에서 저자들이 스스로 드러낸 제약과, 리뷰어로서 짚고 싶은 부분이다. 이해 능력의 파라미터 천장. 저자들이 직접 보여준 대로 0.8B는 4B 이해 교사에 4.9점 뒤진다. 차트 추론처럼 추론 깊이가 필요한 과제라면 이 격차가 실사용에서 체감될 수 있다. 과제 혼합의 민감성. 이해 데이터의 전이 효과가 -0.330에서 +0.639까지 흔들린다는 것은, 이 레시피를 다른 도메인에 옮길 때 혼합 비율과 타이밍을 다시 찾아야 한다 는 뜻이기도 하다. 재현 비용이 낮지 않다. 데이터 엔진이 교사 모델 풀에 의존한다. 의사 라벨의 상한은 결국 8개 전문 모델이 공통으로 잘하는 범위에 묶인다. 공개 OCR 모델들이 모두 약한 영역(희귀 문자 체계, 특수 도메인 조판)에서는 합의가 곧 공통된 오류일 수 있고, 렌더링 검증도 렌더러가 표현할 수 있는 것만 검증한다. 벤치마크 1위가 아
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
[논문리뷰] Xiaomi-OCR-0 Technical Report (0.8B 통합 문서 파싱 VLM). (출처: arXiv:2609.36136, Figure 1) Xiaomi-OCR-0 Technical Report 저자: Xin Chen, Anan Du, Feng Feng, Pei Fu, Jian Luan, Longwei Xu, Shaojie Zhang, Hang Li, Heng Qu, Cheng Tan (SeerRay Team) 공개일: 2026년 9월 28일 (arXiv v1, cs.CV) arXiv: https://arxiv.org/abs/2609.36136 코드: https://github.com/SeerRay-Lab/Xiaomi-OCR-0 모델:…
Открыть источник