Загружаем каталог…
Загружаем каталог…
velog
(출처: arXiv:2609.35069, Figure 1) RenderRank: Learning to Rerank Text with Compressed Visual Tokens Seongtae Hong, Youngjoon Jang, Jungseob Lee, Hyeonseok Moon, Heuiseok Lim 고려대학교 NLP & AI Lab / 숙명여자대학교 (교신저자: Heuiseok Lim) 공개일: 2026년 9월 28일 · arXiv 분류: cs.IR arXiv: https://arxiv.org/abs/2609.35069 코드/모델: 논문 본문에 공개 링크 없음 (2026-09-30 기준) 태그: Reranking Vision-Language Model Visual Text Compression RAG Information Retrieval 🔖 TL;DR (한눈에) 문서를 텍스트 토큰이 아니라 "이미지로 렌더링한 뒤 시각 토큰"으로 넣어 리랭킹하는 리랭커를 제안한다. 리랭킹은 질의 1건당 후보 문서 수십 개를 각각 채점하므로, 문서당 토큰 절감이 후보 수만큼 곱해져 효율 이득이 크다는 점을 공략한다. 학습은 2단계다. 1 텍스트 teacher의 관련도 점수를 시각 입력으로 옮기는 CMRD , 2 같은 질의 안에서 정답/오답 문서의 상대 순서를 다듬는 QLRD . BEIR 11개 데이터셋에서 평균 NDCG@10 55.96 , 입력 토큰은 텍스트 기반 베이스라인보다 16.5~35.5% 적다 . 4B 미만 베이스라인은 전부 앞섰다. 롱 도큐먼트 4종에서는 평균 NDCG@10 88.27 (표 내 최고)에 토큰은 약 절반(4,637.7 vs 10,060.9), 처리량은 최고 베이스라인의 1.70배 . 한 줄 요약 : 문서를 읽히기 좋은 텍스트가 아니라 "보기 좋은 이미지"로 바꿔 넣으면, 2.1B 모델로도 4B급 리랭커에 근접한 정확도를 절반 수준의 토큰으로 낼 수 있다. 📄 초록(Abstract) 완역 문서 텍스트를 이미지로 렌더링하면 비전-언어 모델이 문서를 시각 토큰으로 인코딩할 수 있게 되고, 이는 텍스트 입력에 비해 입력 시퀀스 길이를 줄일 수 있다. 이러한 입력 길이 감소는 리랭킹에서 특히 유용한데, 리랭킹에서는 하나의 질의마다 여러 후보 문서를 채점해야 하므로 토큰 절감이 후보 문서 평가마다 적용되기 때문이다. 우리는 RenderRank를 제안한다. 이는 기존 텍스트 기반 리랭커가 사용하는 텍스트 토큰 시퀀스 대신, 압축된 시각적 문서 표현으로부터 질의 의존적 관련도 점수를 학습하는 리랭커다. 학습은 먼저 시각 입력에서 얻은 관련도 점수를 텍스트 기반 teacher의 점수에 정렬시키고, 이후 동일한 질의에 대한 정답 문서와 오답 문서의 상대적 점수를 정교화한다. BEIR의 11개 데이터셋에 걸쳐 RenderRank는 입력 토큰을 16.5~35.5% 더 적게 사용하면서 평균 NDCG@10 55.96을 달성했으며, 이는 평가한 4B 파라미터 미만의 모든 텍스트 기반 베이스라인과 일부 더 큰 모델을 능가한다. 4개의 롱 도큐먼트 데이터셋에서는 평가한 텍스트 기반 리랭커들의 평균 입력 토큰 수의 약 절반으로 평균 NDCG@10 88.27을 달성했다. 이 설정에서 RenderRank는 평가한 베이스라인들의 최고 평균 처리량 대비 1.70배의 처리량을 제공한다. 이러한 결과는 압축된 시각적 표현이 정확한 문서 관련도 채점을 뒷받침할 수 있으며, 리랭킹에서 텍스트 토큰 표현을 대체할 수 있는 대안이 됨을 보여준다. 초록을 짧게 정리하면 이렇다. 리랭킹의 비용 구조는 "질의 1개 × 후보 문서 N개"라서, 문서 하나를 줄이는 효과가 N배로 증폭된다. 저자들은 문서를 이미지로 렌더링해 비전 인코더의 패치 병합으로 압축하면 같은 내용을 더 적은 토큰에 담을 수 있다고 보고, 이를 리랭커 학습으로 직접 연결했다. 2단계 학습으로 절대적 점수 보정과 상대적 순서 판별을 나눠 학습하며, 그 결과 2.1B 크기로 BEIR 평균 55.96, 롱 도큐먼트 평균 88.27을 기록했다. 🧩 왜 이 문제가 중요한가 (배경) RAG 파이프라인에서 1차 검색기(BM25, 임베딩 검색 등)는 재현율을 위해 후보를 넉넉히 뽑는다. 그 후보들의 실제 관련도는 편차가 크기 때문에 리랭커가 순서를 다시 매긴다. 문제는 여기서 발생하는 비용이다. 리랭커는 (질의, 문서) 쌍을 하나씩 모델에 통과시키므로, 후보가 50개면 forward pass도 50번이다. 문서 하나가 길면 그 길이가 50번 반복해서 청구된다. 현장에서는 보통 두 가지로 타협한다. 문서를 앞부분만 잘라 넣거나(그러면 관련도 판단에 필요한 근거가 잘려 나갈 수 있다), 전체를 넣되 비용을 감당하거나(후보 수와 문서 길이에 비례해 비용이 누적된다). 논문의 표현을 빌리면 "이 비용들은 검색된 후보 전체에 걸쳐 누적된다". RenderRank가 노리는 지점은 이 트레이드오프 자체를 우회하는 것이다. 문서를 텍스트 토큰으로 넣지 않고 이미지로 렌더링해 시각 토큰으로 넣으면, 비전 인코더의 패치화와 공간 병합 덕분에 같은 글자 수가 더 적은 토큰으로 압축된다. 텍스트를 이미지로 렌더링해도 내용이 보존된다는 선행 연구(Rust et al. 2022; Lyu et al. 2025), 폰트 크기·행간·레이아웃이 정보 보존에 영향을 준다는 분석(Tang et al. 2026), 생성 태스크에서의 토큰 절감 결과(Li et al. 2025c; Cheng et al. 2026)가 이미 있었지만, 리랭킹에 체계적으로 적용한 것은 이 논문이 처음이라고 저자들은 주장한다. 기존 멀티모달 리랭킹 연구와의 차이도 분명히 한다. 이미지-텍스트 리랭킹(Taraday et al. 2026)이나 문서 페이지 이미지 리랭킹(Sun et al. 2026)은 애초에 이미지 형태로 주어진 입력을 다룬다. 반면 RenderRank는 원래 텍스트로 주어진 문서를 일부러 렌더링해서 입력 길이를 줄이는 쪽에 초점을 둔다. 🔬 방법론 렌더링: 문서를 어떻게 그리는가 렌더링 설정은 비전 인코더의 패치 구조에 맞춰 정해졌다. 폰트: Roboto Regular 12pt, 행간 1.0 해상도: 96 DPI, 너비 896px 고정, 높이 최대 896px(32px 단위로 조정) 흰 배경에 검은 글자, 여백 없음, 이미지 너비에서 자동 줄바꿈 비전 인코더의 16×16 패치 + 2×2 공간 병합에 맞춘 크기 긴 문서는 여러 장의 이미지로 렌더링하되 문서 순서를 유지하고 겹침 없이 이어 붙여 하나의 후보 문서로 처리 한다. 이 설정에서 BEIR 기준 (질의, 문서) 쌍당 평균 입력 토큰은 290.07개 다. 백본과 학습 가능한 부분 백본은 Qwen3-VL-Reranker-2B에서 초기화한 2.1B 모델이다. 비전 인코더와 시각 특징 merger는 동결(frozen) 하고, 텍스트 디코더에만 LoRA 를 붙여 학습한다. 시각 표현 추출기는 그대로 두고 "그 표현을 관련도 점수로 바꾸는 부분"만 학습한다는 설계다. 1단계 — CMRD (Cross-Modal Relevance Distillation) 시각 입력으로 매긴 점수를 텍스트 teacher의 점수에 맞추는 회귀 학습이다. $$\mathcal{L} {CMRD} = \mathbb{E} {(q,d)\sim D}\left[\left(s_\theta(q, R(d)) - t(q,d)\right)^2\right]$$ 여기서 $s_\theta(q, R(d))$는 질의 $q$와 렌더링된 문서 이미지 $R(d)$에 대한 student 점수, $t(q,d)$는 텍스트 쌍에 대한 teacher 점수다. Teacher는 Qwen3-Reranker-4B . 이 손실의 핵심 직관은 점수 수준(score-level) 증류 라는 점이다. 텍스트 토큰과 시각 토큰은 개수도 정렬도 다르므로 토큰 단위 대응을 잡을 수 없다. 그런데 "이 질의에 이 문서가 얼마나 관련 있나"라는 스칼라 값은 모달리티와 무관하게 비교 가능하다. 그래서 토큰 정렬 없이도 크로스모달 전이가 성립한다. 학습 데이터는 영어 파인튜닝 코퍼스 157만 건이며, 질의마다 정답 1개와 오답 3개를 골라 628만 개의 (질의, 문서) 쌍 을 만들었다. 2단계 — QLRD (Query-Local Relevance Discrimination) 1단계가 점수의 절대적 눈금을 맞추는 단계라면, 2단계는 같은 질의 안에서의 상대적 순서 를 다듬는다. 질의별 후보 집합으로 범위를 제한한 InfoNCE다. $$\mathcal{L} {QLRD} = -\frac{1}{N}\sum {i} \log \frac{\exp\left(s_\theta(q_i, R(d_i^+))\right)}{\exp\left(s_\theta(q_i, R(d_i^+))\right) + \sum_{j=1}^{K}\exp\left(s_\theta(q_i, R(d_{i,j}^-))\right)}$$ 오답 수는 $K=3$, 데이터는 RLHN-100K를 쓴다. 리랭킹 성능 지표(NDCG@10)는 결국 순위 지표이므로, 절대 점수가 teacher와 잘 맞아도 같은 질의 내 순서가 흔들리면 손해다. 2단계가 그 부분을 직접 겨냥한다. 단계 전환에는 ReLoRA의 merge-and-reinitialize 방식을 쓴다. 1단계 LoRA 업데이트를 백본에 병합한 뒤 새 어댑터를 초기화해 2단계를 시작한다. 두 단계 모두 비전 인코더와 merger는 계속 동결 상태다. 추론 시 전제 처리량 측정은 NVIDIA A6000 48GB에서, 배치 크기를 8부터 OOM 직전까지 두 배씩 올려 최고 처리량 지점을 보고한다. 중요한 전제가 하나 있다. 선행 연구의 관례에 따라 문서 이미지의 시각 임베딩이 미리 계산되어 있다고 가정 한다. 코퍼스가 고정된 검색 시스템에서는 합리적인 가정이지만, 캐시가 없으면 처리량이 절반으로 떨어진다(뒤의 ablation 참조). 📊 실험 결과 BEIR 11개 데이터셋 (NDCG@10) 모델 파라미터 평균 NDCG@10 평균 입력 토큰 BM25 – 41.71 – gte-reranker-modernbert-base 150M 53.20 359.25 mxbai-rerank-large-v1 435M 48.73 347.45 bge-reranker-large 560M 49.87 409.32 LAMAR-600m 560M 55.19 409.32 Qwen3-Reranker-0.6B 600M 54.56 438.70 llama-nemotron-rerank-1b-v2 1.2B 54.27 363.99 mxbai-rerank-large-v2 1.5B 47.15 449.76 LightOn-rerank-PW-2B 2.2B 50.42 416.22 bge-reranker-v2-gemma 2.5B 55.82 399.11 Qwen3-Reranker-4B (teacher) 4B 57.99 438.70 zerank-2-reranker 4B 51.98 380.69 LightOn-rerank-PW-4B 4.5B 52.17 416.22 RenderRank (제안) 2.1B 55.96 290.07 읽는 포인트는 세 가지다. 첫째, 토큰 절감폭이 초록의 수치와 정확히 맞는다. 290.07을 베이스라인 중 가장 적은 347.45와 비교하면 16.5% 절감, 가장 많은 449.76과 비교하면 35.5% 절감이다. 둘째, 4B 미만 구간에서는 RenderRank(55.96)가 최고다. 같은 구간 2위인 bge-reranker-v2-gemma(2.5B, 55.82)를 0.14점 앞선다. 더 큰 모델 중에서도 zerank-2-reranker(4B, 51.98)와 LightOn-rerank-PW-4B(4.5B, 52.17)를 앞선다. 셋째, teacher인 Qwen3-Reranker-4B(57.99)에는 2.03점 뒤진다. 시각 압축이 공짜가 아니라는 뜻이며, 논문도 이를 teacher 초과가 아니라 "절반 크기·2/3 토큰으로 근접"이라는 프레임으로 제시한다. 데이터셋별로 보면 강점과 약점이 갈린다. FEVER 88.92, TREC-COVID 84.82, HotpotQA 78.60처럼 teacher와 거의 붙는 항목이 있는 반면, ArguAna는 69.11로 teacher 75.40 대비 6.29점, Touché-2020은 34.27로 teacher 38.77 대비 4.50점 뒤진다. 논증 검색처럼 미세한 어휘 단서가 중요한 태스크에서 손실이 더 크게 나타난다. 연산 효율 (11개 BEIR 평균) 모델 파라미터 평균 토큰 TFLOPs ↓ QPP ↑ gte-reranker-modernbert-base 150M 359.25 0.07 209.5 Qwen3-Reranker-0.6B 600M 438.70 0.25 53.2 llama-nemotron-rerank-1b-v2 1.2B 363.99 0.52 28.2 LightOn-rerank-PW-2B 2.2B 416.22 0.73 18.3 bge-reranker-v2-gemma 2.5B 399.11 1.10 12.3 Qwen3-Reranker-4B 4B 438.70 2.12 6.1 LightOn-rerank-PW-4B 4.5B 416.22 1.73 7.7 RenderRank 2.1B 290.07 0.63 20.1 QPP는 고정 연산 예산(PetaFLOP) 안에서 후보 전체를 리랭킹할 수 있는 질의 수다. RenderRank는 0.63 TFLOPs / QPP 20.1로, teacher(2.12 TFLOPs / QPP 6.1) 대비 연산량은 약 3분의 1, 처리 가능 질의 수는 약 3.3배다. 정확도 차이 2.03점을 이 비용 차이와 견주는 것이 이 논문의 핵심 거래다. 롱 도큐먼트 4종 (16K 이상 지원 모델만 비교) 모델 평균 NDCG@10 평균 토큰 평균 PPS Qwen3-Reranker-0.6B 87.21 10,060.9 2.66 LightOn-rerank-PW-2B 79.38 10,240.5 0.94 Qwen3-Reranker-4B 88.15 10,060.9 0.80 zerank-2-reranker 88.26 10,003.3 0.74 LightOn-rerank-PW-4B 87.82 10,240.5 0.44 RenderRank 88.27 4,637.7 4.51 여기서는 결과가 훨씬 선명하다. RenderRank가 정확도 1위(88.27)이면서 토큰은 베이스라인의 46.1%(4,637.7 / 10,060.9), 처리량은 최고 베이스라인 2.66 PPS의 1.70배 인 4.51 PPS다. 데이터셋별로는 MLDR 99.74, 2WikiMQA 94.30, QMSum 59.94, SummScreenFD 99.10을 기록했다. 문서가 길어질수록 시각 압축의 이득이 커지는 것은 자연스럽다. 짧은 문서는 렌더링 이미지에 여백이 남아 압축률이 떨어지지만, 긴 문서는 이미지를 빽빽하게 채우기 때문이다. 이 논문의 진짜 활용처는 롱 도큐먼트 리랭킹이라고 읽는 편이 타당하다. 시퀀스 길이 예산을 고정했을 때 (MLDR) 모델 2K 4K 8K gte-reranker-modernbert 93.2 95.8 98.5 llama-nemotron-rerank-1b-v2 97.4 98.5 99.4 Qwen3-Reranker-4B 96.9 98.0 99.6 LightOn-rerank-PW-4B 95.1 97.3 99.5 RenderRank 97.9 99.5 99.7 같은 시퀀스 길이 한도라도 시각 토큰은 더 많은 문서 내용을 담을 수 있다는 것을 보여주는 표다. RenderRank의 2K 성능(97.9)이 경쟁 모델들의 4K 성능을 넘어서고, 4K 성능(99.5)은 텍스트 기반 리랭커의 8K 성능에 준한다. 메모리나 컨텍스트 한도가 먼저 걸리는 환경에서 특히 의미가 있다. Ablation 구성 평균 NDCG@10 RenderRank (전체) 55.96 − 2단계(QLRD) 제외 54.86 − 1·2단계 모두 제외 50.20 구성 PPS ↑ RenderRank 76.83 시각 임베딩 캐싱 없음 37.31 학습을 전혀 하지 않은 VLM 리랭커는 50.20에 머문다. CMRD를 더하면 54.86으로 +4.66점 , QLRD까지 더하면 55.96으로 +1.10점 이 추가된다. 성능의 대부분은 텍스트 teacher로부터의 점수 증류에서 오고, 질의 내 상대 순서 학습이 마무리를 담당하는 구조다. 캐싱 항목도 중요하다. 76.83 → 37.31 PPS로, 캐시가 없으면 처리량이 약 2.06배 나빠진다. 앞서 본 처리량 수치는 임베딩 사전 계산을 전제로 한 값이라는 점을 기억할 필요가 있다. 렌더링 밀도의 트레이드오프 Figure 3은 폰트 크기에 따른 성능·토큰·처리량 변화를 보여준다. 기본값 12pt는 290.07 토큰 / 76.83 PPS / NDCG@10 55.96이다. 폰트를 줄이면 토큰과 처리량이 좋아지고 성능이 내려가며, 키우면 반대로 움직인다. 렌더링 밀도가 정확도-효율의 조절 노브 역할을 한다는 것이 이 분석의 요지다(그래프에서 읽은 10pt·14pt 지점의 정확한 수치는 본문 표로 제시되지 않아 여기서는 옮기지 않는다). 🚧 한계 논문에 별도의 Limitations 절은 없다. 본문에서 확인되는 제약과 리뷰 관점의 한계를 정리하면 다음과 같다. Teacher를 넘지 못한다. BEIR 평균 55.96 vs teacher 57.99로 2.03점 차이가 남는다. 시각 압축에는 대가가 있고, 정확도가 최우선인 상황에서는 여전히 텍스트 기반 대형 리랭커가 유리하다. 처리량 수치는 캐싱 전제다. 시각 임베딩 사전 계산을 가정하며, 캐시 없이는 76.83 → 37.31 PPS로 떨어진다. 문서가 자주 바뀌는 코퍼스에서는 이득이 크게 줄어든다. 렌더링 설정에 민감하다. 폰트 크기와 행간에 따라 결과가 흔들린다(Table 1에서 QASPER F1이 설정별로 41.32~48.72 범위). 비전 인코더의 패치 구조에 맞춘 세팅 튜닝이 필요하다. 영어 중심 실험이다. 학습 코퍼스가 영어이고 BEIR도 영어 벤치마크다. 한국어·중국어·일본어처럼 글자 밀도와 자형이 다른 언어에서 같은 압축률과 정확도가 나올지는 검증되지 않았다. 태스크별 편차가 있다. ArguAna(−6.29점), Touché-2020(−4.50점)처럼 논증 검색 계열에서 teacher 대비 손실이 크다. 재현 정보가 제한적이다. 학습 하이퍼파라미터는 부록에 있고, 본문 기준으로 공개 코드·모델 링크가 확인되지 않는다. 🎯 마무리 이 논문의 기여는 "텍스트를 이미지로 넣으면 토큰이 줄어든다"는 관찰 자체보다, 그 관찰이 리랭킹이라는 태스크에서 유독 비용 효율이 좋다 는 점을 짚고 학습 레시피까지 붙여 검증한 데 있다. 리랭킹은 질의 1건에 후보 N개를 곱하는 구조라서 문서당 절감이 N배로 증폭된다. 이 곱셈 구조를 정확히 겨냥한 것이 설계의 출발점이다. 학습 방법에서 눈여겨볼 점은 점수 수준 증류다. 텍스트와 이미지는 토큰 개수도 정렬도 다르지만, "관련도 점수"라는 스칼라는 모달리티를 건너 비교할 수 있다. 덕분에 잘 학습된 텍스트 리랭커를 시각 입력 리랭커의 teacher로 그대로 쓸 수 있다. 이 트릭은 리랭킹에만 국한되지 않고, 다른 스코어링 태스크의 크로스모달 전이에도 적용 가능한 아이디어로 보인다. 실무 관점의 결론은 조건부다. 짧은 패시지 위주라면 절감폭(16.5~35.5%)이 정확도 손실 2점을 상쇄할 만한지 따져봐야 한다. 반면 긴 문서를 다루고 코퍼스가 비교적 고정되어 임베딩 캐싱이 가능하다면, 정확도 1위에 토큰 절반, 처리량 1.70배라는 조합은 상당히 매력적이다. 컨텍스트 한도가 먼저 병목이 되는 환경에서는 같은 2K 예산으로 경쟁 모델의 4K 수준을 내는 성질도 실질적인 차이를 만든다. 한 걸음 물러나서 보면, 이 흐름은 최근 문서 AI 전반에서 반복되는 질문과 맞닿아 있다. 픽셀은 텍스트 토큰보다 정보 밀도가 높은 컨테이너가 될 수 있는가. RenderRank는 그 질문에 리랭킹이라는 구체적인 현장에서 "그렇다, 다만 조건이 있다"라고 답한 사례다. 📚 출처 / 인용 논문: Seongtae Hong, Youngjoon Jang, Jungseob Lee, Hyeonseok Moon, Heuiseok Lim. RenderRank: Learning to Rerank Text with Compressed Visual Tokens. arXiv:2609.35069 (2026-09-28). https://arxiv.org/abs/2609.35069 HTML 전문: https://arxiv.org/html/2609.35069
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
[논문리뷰] RenderRank: Learning to Rerank Text with Compressed Visual Tokens (텍스트를 이미지로 렌더링하는 리랭커). (출처: arXiv:2609.35069, Figure 1) RenderRank: Learning to Rerank Text with Compressed Visual Tokens Seongtae Hong, Youngjoon Jang, Jungseob Lee, Hyeonseok Moon, Heuiseok Lim 고려대학교 NLP & AI Lab / 숙명여자대학교 (교신저자: Heuiseok Lim) 공개일: 2026년 9월 28일 · arXiv 분류: cs.IR arXiv: https://arxiv.org/abs/2609.35069…
Открыть источник