Загружаем каталог…
Загружаем каталог…
velog
📅 Date : 2026.10.05 🏷️ Tags : #AI #Multimodal #ShowO #Transformer #Diffusion #PaperReview 🎯 이번 주 논문 소개 Show-o: One Single Transformer to Unify Multimodal Understanding and Generation 은 이미지 이해와 생성을 하나의 Transformer로 수행하는 모델을 제안한 논문이다. 텍스트에는 자기회귀(Autoregressive) 방식을, 이미지에는 이산 확산(Discrete Diffusion) 방식을 적용한다. 이를 통해 이미지 질의응답, 텍스트 기반 이미지 생성, 이미지 일부 수정 및 확장, 텍스트와 이미지가 섞인 출력 등을 지원한다. 핵심은 하나의 모델 안에서 각 모달리티에 적합한 예측 방식을 함께 사용하는 것 이다. 저자: Jinheng Xie et al. · ICLR 2025 이 글은 첨부 논문의 arXiv v7(2025.09.08)을 기준으로 작성했다. 실험 수치는 직접 재현한 결과가 아니라 논문에서 보고한 값이다. 📌 Contents 선행 연구 서론 주요 방법론 실험 결과 결론 및 한계점 인사이트 도출 1️⃣ 선행 연구 ✨ LLaVA: 이미지를 이해하는 언어 모델 LLaVA와 같은 멀티모달 언어 모델은 사전학습된 시각 인코더가 추출한 이미지 특징을 LLM의 입력 공간으로 연결한다. 예를 들어 CLIP의 이미지 특징을 projection으로 변환한 뒤 텍스트와 함께 입력하면, 모델은 이미지에 관한 질문에 텍스트로 답할 수 있다. 이 구조는 이미지 이해에 효과적이지만, 그것만으로 이미지 자체를 생성하는 기능까지 제공하는 것은 아니다. 이미지를 보고 설명하는 능력과 실제 이미지 토큰을 만들어내는 능력은 서로 다른 학습이 필요하다. ✨ Diffusion과 MaskGIT: 이미지를 생성하는 방법 Stable Diffusion과 같은 모델은 노이즈를 점차 제거하면서 이미지를 생성한다. 대표적인 Latent Diffusion은 연속적인 latent 공간에서 이 과정을 수행한다. 반면 MaskGIT은 이미지를 이산 토큰으로 표현하고, 가려진 토큰을 여러 번에 걸쳐 복원한다. 여러 위치의 토큰을 병렬로 예측할 수 있다는 점이 특징이다. Show-o는 이 마스크 토큰 예측을 단순화된 이산 확산으로 사용한다. 따라서 여기서 말하는 diffusion을 연속 latent에 가우시안 노이즈를 넣고 제거하는 방식과 똑같이 이해하면 안 된다. ✨ NExT-GPT와 Chameleon: 이해와 생성의 통합 이해와 생성을 통합하려는 접근에도 차이가 있다. NExT-GPT는 언어 모델과 별도의 사전학습 생성 모델을 연결하는 방식이다. Chameleon은 텍스트와 이미지를 모두 토큰으로 표현하고, 두 종류의 토큰을 자기회귀적으로 생성한다. 접근 이해·생성 통합 방식 Show-o가 주목한 지점 NExT-GPT 언어 모델과 별도의 생성 모델 연결 하나의 Transformer에서 함께 처리할 수 있을까? Chameleon 텍스트·이미지 모두 자기회귀 생성 이미지도 반드시 한 토큰씩 생성해야 할까? Show-o 텍스트는 자기회귀, 이미지는 이산 확산 모달리티별 예측 방식을 하나의 모델 안에 통합 2️⃣ 서론 ✨ 이미지 이해와 생성을 나누어야 할까? 이미지를 보고 답하는 모델과 글을 보고 이미지를 만드는 모델은 각각 발전해 왔다. 하지만 실제 서비스에서는 두 기능이 함께 필요한 경우가 많다. 사용자가 사진을 보여주고 내용을 질문한 뒤, 같은 사진의 일부를 수정해 달라고 요청할 수도 있기 때문이다. 논문은 이해 모델과 생성 모델 모두 Transformer를 활용한다는 점에서 출발한다. 그렇다면 서로 다른 모델을 연결하는 대신, 하나의 Transformer가 두 작업을 담당할 수 있지 않을까? ✨ 통합 모델이라고 생성 방식까지 같아야 하는 것은 아니다 텍스트는 앞서 나온 단어를 바탕으로 다음 단어를 예측하는 자기회귀 방식과 잘 맞는다. 반면 이미지는 여러 공간 위치 사이의 관계가 중요하며, 이미지 토큰을 하나씩 생성하면 토큰 수만큼 순차적인 예측이 필요하다. Show-o의 핵심 아이디어는 모델은 공유하되 텍스트와 이미지의 생성 방식은 다르게 두는 것 이다. 텍스트는 순서대로 생성하고, 이미지는 여러 마스크 토큰을 함께 복원한다. 3️⃣ 주요 방법론 ✨ 1. 텍스트와 이미지를 토큰 시퀀스로 표현하기 출처: Xie et al., Show-o, Figure 2. 하나의 Transformer가 이해, 생성, 혼합 모달 출력을 처리한다. Show-o는 Phi-1.5 기반의 1.3B 모델 이다. 텍스트에는 기존 LLM의 tokenizer를 사용하고, 기본 모델의 이미지에는 MAGVIT-v2를 따르는 이미지 tokenizer를 사용한다. 이미지 tokenizer는 256×256 이미지를 16×16, 즉 256개의 이산 이미지 토큰 으로 변환한다. 각 토큰은 8,192개 코드 중 하나를 나타낸다. 모델의 임베딩 층에는 이를 위한 8,192개의 학습 가능한 임베딩을 추가한다. 여기서 이미지 토큰은 실제 단어가 아니라 이미지 정보를 나타내는 코드다. 이 코드가 임베딩 벡터로 변환되어 Transformer에 입력된다. 생성된 토큰은 이미지 디코더를 거쳐 실제 이미지로 복원된다. 따라서 ‘하나의 Transformer’는 이해와 생성을 담당하는 핵심 모델을 공유한다는 의미이며, 이미지 tokenizer와 decoder까지 없어졌다는 뜻은 아니다. ✨ 2. Unified Prompting: 작업을 입력 형식으로 구분하기 Show-o는 작업을 나타내는 특수 토큰과 텍스트·이미지의 시작 및 종료 토큰을 사용한다. 토큰 의미 [MMU] 멀티모달 이해 작업 [T2I] 텍스트 기반 이미지 생성 작업 [SOT] , [EOT] 텍스트의 시작과 끝 [SOI] , [EOI] 이미지의 시작과 끝 논문의 Figure 4 형식을 간단히 표현하면 다음과 같다. 이미지 이해: [MMU] [SOI] 이미지 토큰 [EOI] [SOT] 텍스트 토큰 [EOT] 이미지 생성: [T2I] [SOT] 텍스트 토큰 [EOT] [SOI] 이미지 토큰 [EOI] 이미지 이해에서는 이미지와 질문을 조건으로 답변을 생성한다. 이미지 생성에서는 텍스트 뒤에 놓인 마스크 이미지 토큰을 복원한다. 작업별 정보를 같은 시퀀스 안에 배치해 하나의 모델이 처리하도록 만든 것이다. ✨ 3. Omni-Attention: 텍스트와 이미지가 정보를 보는 방식 출처: Xie et al., Show-o, Figure 5. 진한 칸은 참조가 허용된 위치, 흰 칸은 차단된 위치다. Omni-Attention은 causal attention과 full attention을 입력 구성에 맞게 결합 한다. 텍스트 토큰: 미래 텍스트를 보지 않도록 causal attention을 적용한다. 같은 이미지 블록의 토큰: 서로의 정보를 참조할 수 있도록 full attention을 적용한다. 모달 간 참조: 이미지 이해에서는 뒤의 텍스트가 앞의 이미지를, 이미지 생성에서는 뒤의 이미지가 앞의 텍스트를 참조한다. 예를 들어 “고양이를 그려줘”라는 텍스트 뒤에 이미지 토큰이 있다면, 이미지 토큰은 앞의 요청과 같은 이미지 안의 다른 위치를 함께 참고한다. 다만 혼합 시퀀스에서 미래의 모든 이미지와 텍스트를 무조건 볼 수 있다는 뜻은 아니다. 시퀀스의 순서와 이미지 블록의 경계를 유지한다. 이전 실습의 ‘누가 누구를 참조하는가’와 연결해 이해할 수 있지만, 구조는 구분해야 한다. Show-o는 별도의 LDM식 Cross-Attention 모듈로 설명하기보다, 통합 시퀀스의 attention mask를 조절하는 구조 로 이해하는 것이 정확하다. 또한 attention 층에 QK-Norm을 적용한다. ✨ 4. 텍스트는 NTP, 이미지는 MTP로 학습하기 텍스트에는 Next Token Prediction(NTP) 을 적용한다. 앞의 텍스트와 조건 이미지를 보고 다음 텍스트 토큰을 예측하는 방식이다. 이미지에는 Mask Token Prediction(MTP) 을 적용한다. 이미지 토큰 일부를 무작위 비율로 가린 뒤, 텍스트와 남아 있는 이미지 토큰을 참고하여 원래 토큰을 복원한다. 이때 이미지 손실은 마스킹된 위치에만 적용한다. 학습 목표는 두 항의 가중 결합이다. 최소화하는 음의 로그우도 손실로 표현하면 다음과 같이 정리할 수 있다. $$ \mathcal{L}=\mathcal{L} {\mathrm{MTP}}+\alpha\mathcal{L} {\mathrm{NTP}} $$ 여기서 α는 텍스트 예측 손실의 비중을 조절한다. 논문 본문의 식 (1), (2)는 최대화하는 로그우도로 서술되어 있으므로, 구현에서 최소화할 때는 부호를 구분해야 한다. ✨ 5. 이미지 생성은 마스크를 반복적으로 복원하는 과정 생성은 이미지 영역을 모두 [MASK] 로 채운 상태에서 시작한다. 입력 텍스트를 조건으로 여러 이미지 위치의 토큰을 병렬 예측한다. 예측 확신도가 낮은 위치를 다시 마스킹한다. 마스크의 수를 점차 줄이면서 예측과 복원을 반복한다. 완성된 이미지 토큰을 디코더로 복원한다. 학습도 단계적으로 진행된다. 먼저 이미지 토큰 임베딩과 이미지 내부 관계를 학습하고, 이어서 텍스트–이미지 정렬을 강화한 뒤, 고품질 이미지·텍스트 및 instruction 데이터로 미세조정한다. 이미지 생성에 필요한 텍스트 조건은 모델 자체가 인코딩한다. 이 마스크 복원 방식은 이미지 편집으로도 연결된다. 수정할 영역의 토큰만 가리면 inpainting , 이미지 바깥 영역에 마스크를 추가하면 extrapolation 을 수행할 수 있다. 논문에서는 이 작업들을 위한 별도 미세조정 없이 활용하는 예시를 제시한다. 4️⃣ 실험 결과 ✨ 1. 이미지 이해: 기본 모델과 CLIP 개선 버전의 차이 아래는 논문 Table 1에서 주요 비교 대상을 발췌한 결과다. Show-o‡는 이미지 이해 입력에 CLIP-ViT의 연속 특징을 사용하는 개선 버전 이다. 모델 파라미터 POPE ↑ MME ↑ VQAv2 ↑ GQA ↑ MMMU ↑ LLaVA-v1.5-Phi-1.5 1.3B 84.1 1128.0 75.3 56.5 30.7 Show-o 1.3B 80.0 1097.2 69.4 58.0 26.7 Show-o‡ 1.3B 84.5 1232.9 74.7 61.0 27.4 기본 Show-o는 GQA에서 비교 모델보다 높지만, VQAv2와 MMMU 등에서는 낮다. 따라서 ‘이미지 이해에서도 모든 지표에서 우수하다’고 해석하기는 어렵다. CLIP 특징을 사용한 Show-o‡는 기본 모델보다 성능이 개선된다. 특히 MME는 1097.2 → 1232.9 , GQA는 58.0 → 61.0 으로 상승한다. 이 결과는 모델의 통합 구조뿐 아니라 어떤 이미지 표현을 입력으로 사용하는지 도 이해 성능에 중요하다는 점을 보여준다. ✨ 2. 이미지 생성: FID와 GenEval FID는 생성 이미지 집합과 실제 이미지 집합의 특징 분포가 얼마나 다른지 측정하며, 낮을수록 좋다. 논문 Table 2의 MSCOCO zero-shot FID-30K 결과는 다음과 같다. 모델 파라미터 FID-30K ↓ LDM 1.4B 12.64 SDv1.5 0.9B 9.62 DreamLLM 7B 8.76 Show-o 1.3B 9.24 Show-o는 35M 이미지–텍스트 학습 데이터로 FID 9.24 를 기록했다. LDM과 SDv1.5보다 낮지만, DreamLLM보다 높다. 모델 크기와 학습 조건이 서로 다르므로 구조 하나만의 효과로 해석하지는 않아야 한다. 또한 이 35M 설정을 논문의 모든 실험에 공통으로 적용하면 안 된다. 이미지 이해의 데이터 규모 실험에는 2.0B 이미지–텍스트 쌍을 사용한 설정도 포함된다. 출처: Xie et al., Show-o, Table 3. 텍스트에 지정된 객체·수량·색상·위치 등을 얼마나 잘 반영했는지 평가한다. GenEval의 주요 결과를 정리하면 다음과 같다. 모델 단일 객체 두 객체 수량 색상 위치 색상 속성 연결 Overall ↑ SDv1.5 0.97 0.38 0.35 0.76 0.04 0.06 0.43 SD3 (d=24) 0.98 0.74 0.63 0.67 0.34 0.36 0.62 Show-o 0.98 0.80 0.66 0.84 0.31 0.50 0.68 Show-o‡ 0.98 0.85 0.67 0.81 0.28 0.55 0.69 기본 Show-o의 Overall은 0.68 로, 표에 보고된 SD3의 0.62 보다 높다. 특히 두 객체와 색상 속성 연결에서 강점을 보인다. 다만 위치 관계에서는 0.31 로 SD3의 0.34 보다 낮다. 전체 점수가 높아도 모든 유형의 요청을 더 잘 처리하는 것은 아니다. ✨ 3. 데이터 규모와 해상도의 영향 논문 Table 4에서는 기본 이산 이미지 토큰 설정에서 데이터와 해상도를 늘렸을 때의 변화를 확인한다. 이미지–텍스트 쌍 해상도 VQAv2 ↑ GQA ↑ 35M 256×256 59.3 48.7 2.0B 256×256 64.7 54.2 2.0B 512×512 69.4 58.0 데이터 규모를 늘리면 텍스트와 이미지의 대응을 더 많이 학습할 수 있고, 해상도를 높이면 더 많은 이미지 정보를 활용할 수 있다. 두 조건을 확대한 결과 VQAv2는 59.3 → 69.4 , GQA는 48.7 → 58.0 으로 개선된다. 다만 모든 지표가 각 단계에서 반드시 상승하는 것은 아니다. 예를 들어 원문 표의 MMMU는 데이터만 늘리는 단계에서 25.1에서 25.0으로 소폭 낮아진다. ✨ 4. 샘플링 효율과 응용 Appendix I는 512×512 이미지 생성에서 샘플링 단계를 5, 25, 50으로 늘릴수록 세부 표현과 프롬프트 반영이 개선되는 정성적 예시를 제시한다. 같은 해상도에서 1,024개 토큰을 하나씩 생성하는 자기회귀 방식과 비교하면 50단계는 약 20배 적은 샘플링 단계다. 그러나 단계 수가 20배 적다는 사실을 실제 실행 속도가 20배 빠르다는 뜻으로 해석하면 안 된다. 단계당 연산량과 실행 환경도 확인해야 한다. 논문 Figure 8에서는 이미지 일부 수정과 확장, 설명문과 영상 키프레임을 번갈아 생성하는 예시도 보여준다. 영상 이해·생성으로의 확장 역시 다루지만, 해당 결과는 주로 정성적 사례이므로 광범위한 영상 성능이 검증됐다고 확대 해석하지 않는 것이 좋다. 5️⃣ 결론 및 한계점 ✨ 결론 Show-o는 하나의 Transformer 안에 텍스트의 자기회귀 예측과 이미지의 마스크 토큰 복원을 결합하여, 멀티모달 이해와 생성을 함께 수행할 수 있음을 보여준다. 특히 통합 모델을 만들기 위해 모든 모달리티에 동일한 생성 규칙을 강제할 필요가 없다는 점이 중요하다. 공통된 토큰 시퀀스와 모델을 사용하면서도 attention 방식과 학습 목표를 구분할 수 있다. 실험에서는 1.3B 규모로 경쟁력 있는 이미지 생성 성능을 보였고, 이미지 이해도 지원했다. 다만 이해 성능은 입력 표현과 데이터 규모의 영향을 크게 받았으며, 지표별 장단점이 존재했다. ✨ 한계점 및 후속 연구 첫째, 이미지 속 문자와 객체 수·관계 처리에 오류가 남는다. Appendix K는 문자 인식, 지정한 글자 생성, 객체 수 세기, 사람마다 스키 장비를 올바르게 배치하는 문제 등을 실패 사례로 제시한다. 저자들은 관련 데이터의 부족을 원인으로 설명하고, 이러한 사례를 다루는 데이터를 보강하는 방향을 제안한다. 둘째, 이산 이미지 토큰을 언어 공간에 정렬하는 데 많은 데이터가 필요하다. CLIP처럼 이미 이미지–텍스트 대응을 학습한 특징과 달리, 기본 Show-o는 새로운 이미지 토큰 임베딩의 정렬을 학습해야 한다. 데이터 규모 실험과 CLIP 개선 버전의 결과가 이 어려움을 보여준다. 셋째, 평가 지표와 비교 조건을 함께 보아야 한다. 논문도 FID만으로 생성 품질을 충분히 평가하기 어렵다고 설명한다. 미학적 이미지로 미세조정한 모델의 출력 분포는 MSCOCO와 다를 수 있기 때문이다. 후속 평가에서는 품질뿐 아니라 요청 준수, 세부 관계, 사용자 평가를 함께 확인할 필요가 있다. 넷째, 통합의 실용적 이득은 추가 검증이 필요하다. 이는 리뷰를 통해 생각한 후속 연구 방향이다. 모델을 공유하면 시스템 구성이 단순해질 수 있지만, 실제 메모리 사용량이나 응답 지연이 얼마나 줄어드는지는 별도 측정해야 한다. 이해와 생성을 함께 학습할 때 서로의 성능을 방해하는지도 작업별로 살펴볼 필요가 있다. 6️⃣ 인사이트 도출 💡 학습 앱에서 ‘설명’과 ‘시각적 예시’를 함께 제공하기 학습을 돕는 AI 서비스를 생각하면, 사용자가 문제나 그림을 올렸을 때 내용을 이해하고 설명하는 기능뿐 아니라 이해를 돕는 새로운 그림을 만드는 기능도 유용하다. 예를 들어 과학 개념을 어려워하는 사용자에게 먼저 짧은 설명을 제공하고, 이어서 그 설명에 맞는 시각적 예시를 생성할 수 있다. 사용자가 그림의 특정 부분을 바꾸어 달라고 하면 해당 영역을 수정하는 상호작용으로 이어질 수 있다. Show-o의 혼합 모달 출력과 마스크 기반 편집은 이런 흐름을 설계할 때 참고할 수 있는 아이디어다. 다만 교육용 그림은 보기 좋은 것보다 내용이 정확한 것이 중요하다. 논문에서도 문자와 수량, 객체 관계에 오류가 있었으므로, 정답 숫자나 핵심 용어는 코드와 별도 텍스트 렌더링으로 표시하고 생성 모델은 설명용 삽화를 담당하도록 역할을 나누는 방안을 생각해 볼 수 있다. 💡 모델 통합과 사용자 경험은 따로 검증해야 한다 이 논문을 읽으며 가장 인상적이었던 점은, 하나의 모델로 통합하더라도 텍스트와 이미지의 처리 방식은 달라질 수 있다는 것이다. 서비스에서도 모든 정보를 같은 방식으로 제공하기보다, 개념 설명에는 텍스트를, 공간적 관계에는 그림을 활용하는 식으로 표현을 선택할 수 있다. 또한 설명과 이미지를 모두 생성할 수 있다는 사실만으로 학습 효과가 좋아지는 것은 아니다. 실제로 적용한다면 텍스트만 제공하는 조건과 텍스트·그림을 함께 제공하는 조건을 비교하여 이해도, 문제 해결 시간, 잘못 이해한 비율 을 측정하고 싶다. 모델의 기능을 늘리는 것과 사용자에게 도움이 되는 경험을 만드는 것은 각각 확인해야 할 문제라고 생각한다. 📚 References Xie, J. et al. Show-o: One Single Transformer to Unify Multimodal Understanding and Generation. ICLR 2025. 이 글의 방법론·수치·그림은 첨부된 arXiv v7(2025.09.08)을 기준으로 정리했다. 논문 Show Lab. Show-o 공식 코드 저장소. GitHub 선행 연구의 비교는 Show-o의 Related Work와 본문에 근거했다: Liu et al., Visual Instruction Tuning (2023); Rombach et al., High-Resolution Image Synthesis with Latent Diffusion Models (2022); Chang et al., MaskGIT: Masked Generative Image Transformer (2022); Wu et al., NExT-GPT: Any-to-Any Multimodal LLM (2023 preprint); Chameleon Team, Chameleon: Mixed-Modal Early-Fusion Foundation Models (2024). 그림 2·5 및 표 3의 저작권은 원저자에게 있으며, 출처를 표시하여 논문 설명과 비평 목적으로 인용했다.
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
[투빅스 6주차 논문리뷰] SHOW-O: ONE SINGLE TRANSFORMER TO UNIFY MULTIMODAL UNDERSTANDING AND GENERATION. 📅 Date : 2026.10.05 🏷️ Tags : #AI #Multimodal #ShowO #Transformer #Diffusion #PaperReview 🎯 이번 주 논문 소개 Show-o: One Single Transformer to Unify Multimodal Understanding and Generation 은 이미지 이해와 생성을 하나의 Transformer로 수행하는 모델을 제안한 논문이다. 텍스트에는 자기회귀(Autoregressive) 방식을, 이미지에는 이산 확산(Discrete Diffusion) 방식을…
Открыть источник