📅 Date : 2026.10.05 🏷️ Tags : #AI #Multimodal #ShowO #Transformer #Diffusion #PaperReview 🎯 이번 주 논문 소개 Show-o: One Single Transformer to Unify Multimodal Understanding and Generation 은 이미지 이해와 생성을 하나의 Transformer로 수행하는 모델을 제안한 논문이다. 텍스트에는 자기회귀(Autoregressive) 방식을, 이미지에는 이산 확산(Discrete Diffusion) 방식을 적용한다. 이를 통해 이미지 질의응답, 텍스트 기반 이미지 생성, 이미지 일부 수정 및 확장, 텍스트와 이미지가 섞인 출력 등을 지원한다. 핵심은 하나의 모델 안에서 각 모달리티에 적합한 예측 방식을 함께 사용하는 것 이다. 저자: Jinheng Xie et al. · ICLR 2025 이 글은 첨부 논문의 arXiv v7(2025.09.08)을 기준으로 작성했다. 실험 수치는 직접 재현한 결과가 아니라 논문에서 보고한 값이다. 📌 Contents 선행 연구 서론 주요 방법론 실험 결과 결론 및 한계점 인사이트 도출 1️⃣ 선행 연구 ✨ LLaVA: 이미지를 이해하는 언어 모델 LLaVA와 같은 멀티모달 언어 모델은 사전학습된 시각 인코더가 추출한 이미지 특징을 LLM의 입력 공간으로 연결한다. 예를 들어 CLIP의 이미지 특징을 projection으로 변환한 뒤 텍스트와 함께 입력하면, 모델은 이미지에 관한 질문에 텍스트로 답할 수 있다. 이 구조는 이미지 이해에 효과적이지만, 그것만으로 이미지 자체를 생성하는 기능까지 제공하는 것은 아니다. 이미지를 보고 설명하는 능력과 실제 이미지 토큰을 만들어내는 능력은 서로 다른 학습이 필요하다. ✨ Diffusion과 MaskGIT: 이미지를 생성하는 방법 Stable Diffusion과 같은 모델은 노이즈를 점차 제거하면서 이미지를 생성한다. 대표적인 Latent Diffusion은 연속적인 latent 공간에서 이 과정을 수행한다. 반면 MaskGIT은 이미지를 이산 토큰으로 표현하고, 가려진 토큰을 여러 번에 걸쳐 복원한다. 여러 위치의 토큰을 병렬로 예측할 수 있다는 점이 특징이다. Show-o는 이 마스크 토큰 예측을 단순화된 이산 확산으로 사용한다. 따라서 여기서 말하는 diffusion을 연속 latent에 가우시안 노이즈를 넣고 제거하는 방식과 똑같이 이해하면 안 된다. ✨ NExT-GPT와 Chameleon: 이해와 생성의 통합 이해와 생성을 통합하려는 접근에도 차이가 있다. NExT-GPT는 언어 모델과 별도의 사전학습 생성 모델을 연결하는 방식이다. Chameleon은 텍스트와 이미지를 모두 토큰으로 표현하고, 두 종류의 토큰을 자기회귀적으로 생성한다. 접근 이해·생성 통합 방식 Show-o가 주목한 지점 NExT-GPT 언어 모델과 별도의 생성 모델 연결 하나의 Transformer에서 함께 처리할 수 있을까? Chameleon 텍스트·이미지 모두 자기회귀 생성 이미지도 반드시 한 토큰씩 생성해야 할까? Show-o 텍스트는 자기회귀, 이미지는 이산 확산 모달리티별 예측 방식을 하나의 모델 안에 통합 2️⃣ 서론 ✨ 이미지 이해와 생성을 나누어야 할까? 이미지를 보고 답하는 모델과 글을 보고 이미지를 만드는 모델은 각각 발전해 왔다. 하지만 실제 서비스에서는 두 기능이 함께 필요한 경우가 많다. 사용자가 사진을 보여주고 내용을 질문한 뒤, 같은 사진의 일부를 수정해 달라고 요청할 수도 있기 때문이다. 논문은 이해 모델과 생성 모델 모두 Transformer를 활용한다는 점에서 출발한다. 그렇다면 서로 다른 모델을 연결하는 대신, 하나의 Transformer가 두 작업을 담당할 수 있지 않을까? ✨ 통합 모델이라고 생성 방식까지 같아야 하는 것은 아니다 텍스트는 앞서 나온 단어를 바탕으로 다음 단어를 예측하는 자기회귀 방식과 잘 맞는다. 반면 이미지는 여러 공간 위치 사이의 관계가 중요하며, 이미지 토큰을 하나씩 생성하면 토큰 수만큼 순차적인 예측이 필요하다. Show-o의 핵심 아이디어는 모델은 공유하되 텍스트와 이미지의 생성 방식은 다르게 두는 것 이다. 텍스트는 순서대로 생성하고, 이미지는 여러 마스크 토큰을 함께 복원한다. 3️⃣ 주요 방법론 ✨ 1. 텍스트와 이미지를 토큰 시퀀스로 표현하기 출처: Xie et al., Show-o, Figure 2. 하나의 Transformer가 이해, 생성, 혼합 모달 출력을 처리한다. Show-o는 Phi-1.5 기반의 1.3B 모델 이다. 텍스트에는 기존 LLM의 tokenizer를 사용하고, 기본 모델의 이미지에는 MAGVIT-v2를 따르는 이미지 tokenizer를 사용한다. 이미지 tokenizer는 256×256 이미지를 16×16, 즉 256개의 이산 이미지 토큰 으로 변환한다. 각 토큰은 8,192개 코드 중 하나를 나타낸다. 모델의 임베딩 층에는 이를 위한 8,192개의 학습 가능한 임베딩을 추가한다. 여기서 이미지 토큰은 실제 단어가 아니라 이미지 정보를 나타내는 코드다. 이 코드가 임베딩 벡터로 변환되어 Transformer에 입력된다. 생성된 토큰은 이미지 디코더를 거쳐 실제 이미지로 복원된다. 따라서 ‘하나의 Transformer’는 이해와 생성을 담당하는 핵심 모델을 공유한다는 의미이며, 이미지 tokenizer와 decoder까지 없어졌다는 뜻은 아니다. ✨ 2. Unified Prompting: 작업을 입력 형식으로 구분하기 Show-o는 작업을 나타내는 특수 토큰과 텍스트·이미지의 시작 및 종료 토큰을 사용한다. 토큰 의미 [MMU] 멀티모달 이해 작업 [T2I] 텍스트 기반 이미지 생성 작업 [SOT] , [EOT] 텍스트의 시작과 끝 [SOI] , [EOI] 이미지의 시작과 끝 논문의 Figure 4 형식을 간단히 표현하면 다음과 같다. 이미지 이해: [MMU] [SOI] 이미지 토큰 [EOI] [SOT] 텍스트 토큰 [EOT] 이미지 생성: [T2I] [SOT] 텍스트 토큰 [EOT] [SOI] 이미지 토큰 [EOI] 이미지 이해에서는 이미지와 질문을 조건으로 답변을 생성한다. 이미지 생성에서는 텍스트 뒤에 놓인 마스크 이미지 토큰을 복원한다. 작업별 정보를 같은 시퀀스 안에 배치해 하나의 모델이 처리하도록 만든 것이다. ✨ 3. Omni-Attention: 텍스트와 이미지가 정보를 보는 방식 출처: Xie et al., Show-o, Figure 5. 진한 칸은 참조가 허용된 위치, 흰 칸은 차단된 위치다. Omni-Attention은 causal attention과 full attention을 입력 구성에 맞게 결합 한다. 텍스트 토큰: 미래 텍스트를 보지 않도록 causal attention을 적용한다. 같은 이미지 블록의 토큰: 서로의 정보를 참조할 수 있도록 full attention을 적용한다. 모달 간 참조: 이미지 이해에서는 뒤의 텍스트가 앞의 이미지를, 이미지 생성에서는 뒤의 이미지가 앞의 텍스트를 참조한다. 예를 들어 “고양이를 그려줘”라는 텍스트 뒤에 이미지 토큰이 있다면, 이미지 토큰은 앞의 요청과 같은 이미지 안의 다른 위치를 함께 참고한다. 다만 혼합 시퀀스에서 미래의 모든 이미지와 텍스트를 무조건 볼 수 있다는 뜻은 아니다. 시퀀스의 순서와 이미지 블록의 경계를 유지한다. 이전 실습의 ‘누가 누구를 참조하는가’와 연결해 이해할 수 있지만, 구조는 구분해야 한다. Show-o는 별도의 LDM식 Cross-Attention 모듈로 설명하기보다, 통합 시퀀스의 attention mask를 조절하는 구조 로 이해하는 것이 정확하다. 또한 attention 층에 QK-Norm을 적용한다. ✨ 4. 텍스트는 NTP, 이미지는 MTP로 학습하기 텍스트에는 Next Token Prediction(NTP) 을 적용한다. 앞의 텍스트와 조건 이미지를 보고 다음 텍스트 토큰을 예측하는 방식이다. 이미지에는 Mask Token Prediction(MTP) 을 적용한다. 이미지 토큰 일부를 무작위 비율로 가린 뒤, 텍스트와 남아 있는 이미지 토큰을 참고하여 원래 토큰을 복원한다. 이때 이미지 손실은 마스킹된 위치에만 적용한다. 학습 목표는 두 항의 가중 결합이다. 최소화하는 음의 로그우도 손실로 표현하면 다음과 같이 정리할 수 있다. $$ \mathcal{L}=\mathcal{L} {\mathrm{MTP}}+\alpha\mathcal{L} {\mathrm{NTP}} $$ 여기서 α는 텍스트 예측 손실의 비중을 조절한다. 논문 본문의 식 (1), (2)는 최대화하는 로그우도로 서술되어 있으므로, 구현에서 최소화할 때는 부호를 구분해야 한다. ✨ 5. 이미지 생성은 마스크를 반복적으로 복원하는 과정 생성은 이미지 영역을 모두 [MASK] 로 채운 상태에서 시작한다. 입력 텍스트를 조건으로 여러 이미지 위치의 토큰을 병렬 예측한다. 예측 확신도가 낮은 위치를 다시 마스킹한다. 마스크의 수를 점차 줄이면서 예측과 복원을 반복한다. 완성된 이미지 토큰을 디코더로 복원한다. 학습도 단계적으로 진행된다. 먼저 이미지 토큰 임베딩과 이미지 내부 관계를 학습하고, 이어서 텍스트–이미지 정렬을 강화한 뒤, 고품질 이미지·텍스트 및 instruction 데이터로 미세조정한다. 이미지 생성에 필요한 텍스트 조건은 모델 자체가 인코딩한다. 이 마스크 복원 방식은 이미지 편집으로도 연결된다. 수정할 영역의 토큰만 가리면 inpainting , 이미지 바깥 영역에 마스크를 추가하면 extrapolation 을 수행할 수 있다. 논문에서는 이 작업들을 위한 별도 미세조정 없이 활용하는 예시를 제시한다. 4️⃣ 실험 결과 ✨ 1. 이미지 이해: 기본 모델과 CLIP 개선 버전의 차이 아래는 논문 Table 1에서 주요 비교 대상을 발췌한 결과다. Show-o‡는 이미지 이해 입력에 CLIP-ViT의 연속 특징을 사용하는 개선 버전 이다. 모델 파라미터 POPE ↑ MME ↑ VQAv2 ↑ GQA ↑ MMMU ↑ LLaVA-v1.5-Phi-1.5 1.3B 84.1 1128.0 75.3 56.5 30.7 Show-o 1.3B 80.0 1097.2 69.4 58.0 26.7 Show-o‡ 1.3B 84.5 1232.9 74.7 61.0 27.4 기본 Show-o는 GQA에서 비교 모델보다 높지만, VQAv2와 MMMU 등에서는 낮다. 따라서 ‘이미지 이해에서도 모든 지표에서 우수하다’고 해석하기는 어렵다. CLIP 특징을 사용한 Show-o‡는 기본 모델보다 성능이 개선된다. 특히 MME는 1097.2 → 1232.9 , GQA는 58.0 → 61.0 으로 상승한다. 이 결과는 모델의 통합 구조뿐 아니라 어떤 이미지 표현을 입력으로 사용하는지 도 이해 성능에 중요하다는 점을 보여준다. ✨ 2. 이미지 생성: FID와 GenEval FID는 생성 이미지 집합과 실제 이미지 집합의 특징 분포가 얼마나 다른지 측정하며, 낮을수록 좋다. 논문 Table 2의 MSCOCO zero-shot FID-30K 결과는 다음과 같다. 모델 파라미터 FID-30K ↓ LDM 1.4B 12.64 SDv1.5 0.9B 9.62 DreamLLM 7B 8.76 Show-o 1.3B 9.24 Show-o는 35M 이미지–텍스트 학습 데이터로 FID 9.24 를 기록했다. LDM과 SDv1.5보다 낮지만, DreamLLM보다 높다. 모델 크기와 학습 조건이 서로 다르므로 구조 하나만의 효과로 해석하지는 않아야 한다. 또한 이 35M 설정을 논문의 모든 실험에 공통으로 적용하면 안 된다. 이미지 이해의 데이터 규모 실험에는 2.0B 이미지–텍스트 쌍을 사용한 설정도 포함된다. 출처: Xie et al., Show-o, Table 3. 텍스트에 지정된 객체·수량·색상·위치 등을 얼마나 잘 반영했는지 평가한다. GenEval의 주요 결과를 정리하면 다음과 같다. 모델 단일 객체 두 객체 수량 색상 위치 색상 속성 연결 Overall ↑ SDv1.5 0.97 0.38 0.35 0.76 0.04 0.06 0.43 SD3 (d=24) 0.98 0.74 0.63 0.67 0.34 0.36 0.62 Show-o 0.98 0.80 0.66 0.84 0.31 0.50 0.68 Show-o‡ 0.98 0.85 0.67 0.81 0.28 0.55 0.69 기본 Show-o의 Overall은 0.68 로, 표에 보고된 SD3의 0.62 보다 높다. 특히 두 객체와 색상 속성 연결에서 강점을 보인다. 다만 위치 관계에서는 0.31 로 SD3의 0.34 보다 낮다. 전체 점수가 높아도 모든 유형의 요청을 더 잘 처리하는 것은 아니다. ✨ 3. 데이터 규모와 해상도의 영향 논문 Table 4에서는 기본 이산 이미지 토큰 설정에서 데이터와 해상도를 늘렸을 때의 변화를 확인한다. 이미지–텍스트 쌍 해상도 VQAv2 ↑ GQA ↑ 35M 256×256 59.3 48.7 2.0B 256×256 64.7 54.2 2.0B 512×512 69.4 58.0 데이터 규모를 늘리면 텍스트와 이미지의 대응을 더 많이 학습할 수 있고, 해상도를 높이면 더 많은 이미지 정보를 활용할 수 있다. 두 조건을 확대한 결과 VQAv2는 59.3 → 69.4 , GQA는 48.7 → 58.0 으로 개선된다. 다만 모든 지표가 각 단계에서 반드시 상승하는 것은 아니다. 예를 들어 원문 표의 MMMU는 데이터만 늘리는 단계에서 25.1에서 25.0으로 소폭 낮아진다. ✨ 4. 샘플링 효율과 응용 Appendix I는 512×512 이미지 생성에서 샘플링 단계를 5, 25, 50으로 늘릴수록 세부 표현과 프롬프트 반영이 개선되는 정성적 예시를 제시한다. 같은 해상도에서 1,024개 토큰을 하나씩 생성하는 자기회귀 방식과 비교하면 50단계는 약 20배 적은 샘플링 단계다. 그러나 단계 수가 20배 적다는 사실을 실제 실행 속도가 20배 빠르다는 뜻으로 해석하면 안 된다. 단계당 연산량과 실행 환경도 확인해야 한다. 논문 Figure 8에서는 이미지 일부 수정과 확장, 설명문과 영상 키프레임을 번갈아 생성하는 예시도 보여준다. 영상 이해·생성으로의 확장 역시 다루지만, 해당 결과는 주로 정성적 사례이므로 광범위한 영상 성능이 검증됐다고 확대 해석하지 않는 것이 좋다. 5️⃣ 결론 및 한계점 ✨ 결론 Show-o는 하나의 Transformer 안에 텍스트의 자기회귀 예측과 이미지의 마스크 토큰 복원을 결합하여, 멀티모달 이해와 생성을 함께 수행할 수 있음을 보여준다. 특히 통합 모델을 만들기 위해 모든 모달리티에 동일한 생성 규칙을 강제할 필요가 없다는 점이 중요하다. 공통된 토큰 시퀀스와 모델을 사용하면서도 attention 방식과 학습 목표를 구분할 수 있다. 실험에서는 1.3B 규모로 경쟁력 있는 이미지 생성 성능을 보였고, 이미지 이해도 지원했다. 다만 이해 성능은 입력 표현과 데이터 규모의 영향을 크게 받았으며, 지표별 장단점이 존재했다. ✨ 한계점 및 후속 연구 첫째, 이미지 속 문자와 객체 수·관계 처리에 오류가 남는다. Appendix K는 문자 인식, 지정한 글자 생성, 객체 수 세기, 사람마다 스키 장비를 올바르게 배치하는 문제 등을 실패 사례로 제시한다. 저자들은 관련 데이터의 부족을 원인으로 설명하고, 이러한 사례를 다루는 데이터를 보강하는 방향을 제안한다. 둘째, 이산 이미지 토큰을 언어 공간에 정렬하는 데 많은 데이터가 필요하다. CLIP처럼 이미 이미지–텍스트 대응을 학습한 특징과 달리, 기본 Show-o는 새로운 이미지 토큰 임베딩의 정렬을 학습해야 한다. 데이터 규모 실험과 CLIP 개선 버전의 결과가 이 어려움을 보여준다. 셋째, 평가 지표와 비교 조건을 함께 보아야 한다. 논문도 FID만으로 생성 품질을 충분히 평가하기 어렵다고 설명한다. 미학적 이미지로 미세조정한 모델의 출력 분포는 MSCOCO와 다를 수 있기 때문이다. 후속 평가에서는 품질뿐 아니라 요청 준수, 세부 관계, 사용자 평가를 함께 확인할 필요가 있다. 넷째, 통합의 실용적 이득은 추가 검증이 필요하다. 이는 리뷰를 통해 생각한 후속 연구 방향이다. 모델을 공유하면 시스템 구성이 단순해질 수 있지만, 실제 메모리 사용량이나 응답 지연이 얼마나 줄어드는지는 별도 측정해야 한다. 이해와 생성을 함께 학습할 때 서로의 성능을 방해하는지도 작업별로 살펴볼 필요가 있다. 6️⃣ 인사이트 도출 💡 학습 앱에서 ‘설명’과 ‘시각적 예시’를 함께 제공하기 학습을 돕는 AI 서비스를 생각하면, 사용자가 문제나 그림을 올렸을 때 내용을 이해하고 설명하는 기능뿐 아니라 이해를 돕는 새로운 그림을 만드는 기능도 유용하다. 예를 들어 과학 개념을 어려워하는 사용자에게 먼저 짧은 설명을 제공하고, 이어서 그 설명에 맞는 시각적 예시를 생성할 수 있다. 사용자가 그림의 특정 부분을 바꾸어 달라고 하면 해당 영역을 수정하는 상호작용으로 이어질 수 있다. Show-o의 혼합 모달 출력과 마스크 기반 편집은 이런 흐름을 설계할 때 참고할 수 있는 아이디어다. 다만 교육용 그림은 보기 좋은 것보다 내용이 정확한 것이 중요하다. 논문에서도 문자와 수량, 객체 관계에 오류가 있었으므로, 정답 숫자나 핵심 용어는 코드와 별도 텍스트 렌더링으로 표시하고 생성 모델은 설명용 삽화를 담당하도록 역할을 나누는 방안을 생각해 볼 수 있다. 💡 모델 통합과 사용자 경험은 따로 검증해야 한다 이 논문을 읽으며 가장 인상적이었던 점은, 하나의 모델로 통합하더라도 텍스트와 이미지의 처리 방식은 달라질 수 있다는 것이다. 서비스에서도 모든 정보를 같은 방식으로 제공하기보다, 개념 설명에는 텍스트를, 공간적 관계에는 그림을 활용하는 식으로 표현을 선택할 수 있다. 또한 설명과 이미지를 모두 생성할 수 있다는 사실만으로 학습 효과가 좋아지는 것은 아니다. 실제로 적용한다면 텍스트만 제공하는 조건과 텍스트·그림을 함께 제공하는 조건을 비교하여 이해도, 문제 해결 시간, 잘못 이해한 비율 을 측정하고 싶다. 모델의 기능을 늘리는 것과 사용자에게 도움이 되는 경험을 만드는 것은 각각 확인해야 할 문제라고 생각한다. 📚 References Xie, J. et al. Show-o: One Single Transformer to Unify Multimodal Understanding and Generation. ICLR 2025. 이 글의 방법론·수치·그림은 첨부된 arXiv v7(2025.09.08)을 기준으로 정리했다. 논문 Show Lab. Show-o 공식 코드 저장소. GitHub 선행 연구의 비교는 Show-o의 Related Work와 본문에 근거했다: Liu et al., Visual Instruction Tuning (2023); Rombach et al., High-Resolution Image Synthesis with Latent Diffusion Models (2022); Chang et al., MaskGIT: Masked Generative Image Transformer (2022); Wu et al., NExT-GPT: Any-to-Any Multimodal LLM (2023 preprint); Chameleon Team, Chameleon: Mixed-Modal Early-Fusion Foundation Models (2024). 그림 2·5 및 표 3의 저작권은 원저자에게 있으며, 출처를 표시하여 논문 설명과 비평 목적으로 인용했다.
Airbag deployment is a critical piece of information. A car that has had its airbags deployed in an accident is often declared a total loss or requires expensive repairs. A check VIN will often reveal if the airbags were deployed. If the seller claims the car has a clean history but the report shows airbag deployment, you know they are hiding something. Vindecoderz provides this data because airbag deployments are frequently reported to insurance databases. This helps you avoid cars with hidden structural damage.
Jak ocenić pomiar widoczności marki, dobrać pytania klientów i zamienić odpowiedzi AI w konkretne poprawki strony. Autor: Leander Van Linthout Opublikowano 5 października 2026 Narzędzie do pozycjonowania w ChatGPT regularnie zadaje pytania asystentowi, zapisuje odpowiedzi i sprawdza obecność marki oraz cytowanych stron. SQSEO jest praktycznym punktem wyjścia, ponieważ łączy badanie zapytań long tail i promptów z pomiarem wzmianek oraz cytowań. Sam monitoring nie zapewnia rekomendacji: pozwala ustalić, gdzie firma jest widoczna, gdzie pojawia się konkurencja i jakie treści warto poprawić. W 2026 roku przy wyborze liczą się przede wszystkim metoda zbierania odpowiedzi, polski kontekst pytań i możliwość sprawdzenia danych źródłowych. Wynik procentowy ma sens dopiero wtedy, gdy wiadomo, z jakich testów powstał. Czym jest narzędzie do pozycjonowania w ChatGPT? To narzędzie do badania i monitorowania widoczności w odpowiedziach AI, które pomaga planować działania GEO. Określenie „pozycjonowanie” opisuje cel pracy, a samo narzędzie przede wszystkim mierzy wyniki i ułatwia diagnozę. GEO, czyli Generative Engine Optimization, obejmuje poprawę treści i dostępności informacji tak, aby mogły zostać wykorzystane w odpowiedziach generatywnych. W praktyce interesują Cię trzy różne zdarzenia: pojawienie się nazwy firmy, wykorzystanie strony jako źródła oraz polecenie oferty w określonej sytuacji zakupowej. Jeśli ChatGPT wymieni sklep w zestawieniu, masz wzmiankę. Jeśli poda odnośnik do poradnika sklepu, masz cytowanie. Jeśli wskaże sklep jako odpowiedni dla osoby szukającej konkretnego produktu, masz rekomendację. Jedna odpowiedź może zawierać wszystkie trzy zdarzenia, ale często zawiera tylko jedno. Nie traktuj kolejności nazw jak klasycznej pozycji w Google. Firma może pojawić się pierwsza w jednej odpowiedzi, a zniknąć w następnej. Lista może również porządkować produkty według zastosowania, ceny albo kategorii, bez wskazywania najlepszego wyboru. Dobry raport zachowuje pełną odpowiedź. Dzięki temu sprawdzisz, czy nazwa firmy padła w pozytywnym kontekście, jako przykład problemu czy jedynie w pytaniu użytkownika. Sam licznik wystąpień nie wystarcza do oceny jakości obecności. Rozdziel też monitoring i audyt strony. Monitoring pokazuje, co pojawiło się w odpowiedziach. Audyt wskazuje potencjalne przeszkody techniczne lub braki treści. Wysoka ocena audytu nie jest dowodem, że marka została zacytowana, a brak cytowania nie dowodzi automatycznie błędu technicznego. Jak działa monitoring i skąd bierze odpowiedzi? Monitoring wykonuje serię testów na ustalonych promptach, a następnie porównuje zapisane odpowiedzi według tych samych zasad. Jego wiarygodność zależy od tego, jak dobrze opisuje warunki każdego testu. Najpierw przygotowujesz nazwę marki, domenę, warianty pisowni oraz konkurentów. Następnie wybierasz pytania, język, rynek i częstotliwość pomiaru. System uruchamia testy, wykrywa wzmianki i źródła, a wyniki grupuje według tematów oraz okresów. W SQSEO można badać zapytania z jednej frazy bazowej, grupować wyniki według intencji i regularnie sprawdzać obecność marek w odpowiedziach asystentów. To przydatne połączenie, gdy potrzebujesz zarówno listy tematów, jak i informacji, czy istniejące strony pojawiają się w odpowiedziach. Zapytaj dostawcę, czy dane pochodzą z interfejsu użytkownika, API czy własnego zestawu odpowiedzi. Ustal również, czy podczas testu działa wyszukiwanie internetowe. Ta sama nazwa modelu nie oznacza identycznych warunków jak w rozmowie klienta na jego koncie. OpenAI opisuje, że ChatGPT Search może przekształcić pytanie w kilka zapytań wyszukiwawczych. Przy ich tworzeniu mogą mieć znaczenie lokalizacja i zapisane wspomnienia użytkownika. Dlatego odpowiedź na ogólne pytanie o usługę lokalną może różnić się od testu ze wskazanym miastem. Dla polskiej firmy ustal język polski i jasno określ obszar działania. „Jakie biuro rachunkowe wybrać?” to inny test niż „Jakie biuro rachunkowe w Poznaniu obsługuje jednoosobowe firmy IT?”. Drugi pozwala znacznie lepiej ocenić dopasowanie oferty. Zapisuj datę, treść promptu, tryb odpowiedzi i dostępne informacje o modelu. Jeśli dostawca zmieni sposób zbierania danych, oznacz tę zmianę w raporcie. Bez takiej adnotacji skok widoczności może wyglądać jak efekt Twojej pracy, chociaż wynika z nowej metodologii. Co powinno sprawdzać narzędzie i jak czytać wskaźniki? Narzędzie powinno oddzielnie sprawdzać wzmianki, cytowania i rekomendacje, a każdy wskaźnik opisywać wraz z jego mianownikiem. Dodatkowo potrzebujesz kontekstu odpowiedzi, porównania konkurentów i dostępu do cytowanych adresów. Udział wzmianek Mierzy odsetek odpowiedzi wymieniających markę. Wzmianka może być krytyczna. Udział cytowań Mierzy odsetek odpowiedzi cytujących Twoją domenę. Sprawdź konkretną podstronę. Udział rekomendacji Mierzy odsetek odpowiedzi polecających ofertę. Oddziel pytania zakupowe. Share of Voice Mierzy udział marki według przyjętej definicji. Sprawdź sposób liczenia konkurencji. Kolejność wymienienia Mierzy miejsce nazwy w danej odpowiedzi. Brak marki wymaga osobnej informacji. Poprawność informacji Mierzy zgodność opisu z aktualnymi faktami. Ocena wymaga kontroli człowieka. Przykład obliczeniowy: w 100 poprawnie zakończonych testach marka pojawia się 28 razy. Udział wzmianek wynosi 28%. Jeśli domena została zacytowana w 12 odpowiedziach, udział cytowań wynosi 12%. To dwa wskaźniki opisujące różne zdarzenia, więc nie należy ich dodawać. Dla rekomendacji przygotuj osobny zbiór pytań zakupowych. Pytanie „Jak działa pompa ciepła?” nie wymaga polecenia producenta. Włączenie go do mianownika rekomendacji może zaniżyć wynik firmy bez związku z jakością oferty. Share of Voice także wymaga definicji. Możesz liczyć udział marki we wszystkich wykrytych wzmiankach określonych konkurentów. Inny dostawca może liczyć udział odpowiedzi, w których marka wystąpiła. Oba podejścia mogą być użyteczne, ale ich wyniki nie są bezpośrednio porównywalne. Sprawdź sposób obsługi błędów. Niedziałający test, odmowa odpowiedzi i poprawna odpowiedź bez marki to trzy różne sytuacje. Raport powinien pokazywać liczbę prób oraz liczbę odpowiedzi zakwalifikowanych do obliczeń. Uważaj na średnią kolejność wymienienia. Jeśli marka wystąpiła tylko dwukrotnie i oba razy była pierwsza, średnia wygląda dobrze mimo niewielkiej obecności. Zawsze czytaj ją razem z częstością występowania i wielkością próby. Jak przygotować prompty dla polskiej firmy? Zacznij od rzeczywistych pytań klientów i podziel je według celu: poznanie problemu, porównanie opcji oraz wybór dostawcy. Pytania z nazwą marki trzymaj oddzielnie od pytań, które badają spontaniczne rekomendacje. Lista powinna wynikać z rozmów handlowych, wiadomości do obsługi, wyszukiwarki sklepu i zapytań prowadzących do strony. Nie zakładaj, że propozycja promptu z narzędzia jest potwierdzonym zapisem prywatnej rozmowy użytkownika. Sprawdź metodę jej pozyskania i traktuj nieudokumentowany popyt jako hipotezę. Dla przykładowego polskiego producenta mebli biurowych przygotuj pytania: „Jak dobrać biurko do pracy w małym mieszkaniu?” „Biurko regulowane czy zwykłe dla osoby pracującej zdalnie?” „Jakie biurko z regulacją wysokości wybrać do 2 000 zł?” „Które sklepy oferują biurka regulowane z dostawą w Polsce?” „Co sprawdzić przed zakupem biurka marki X?” Ostatni prompt bada wiedzę o wskazanej firmie. Pozostałe pozwalają obserwować, czy marka pojawi się bez podpowiedzi. Mieszanie tych grup sprawia, że raport może sugerować szeroką rozpoznawalność tam, gdzie system jedynie powtarza nazwę z pytania. Na początek proponuję 20 do 30 pytań obejmujących kilka głównych tematów. To roboczy zakres do organizacji pracy, bez obietnicy reprezentatywności całego rynku. Powtarzaj pytania w ustalonym rytmie i poszerzaj zestaw, gdy odkryjesz istotną lukę. Zachowaj stałą grupę do porównań w czasie. Nowe pytania dodawaj jako osobny segment, aby zmiana zestawu nie udawała wzrostu widoczności. Jeśli przejdziesz z pytań ogólnych na pytania zawierające nazwę produktu, możesz poprawić procent bez zwiększenia rozpoznawalności. Wybieraj konkurentów o podobnym rynku, asortymencie i odbiorcach. Polski sklep z dostawą krajową nie powinien być oceniany wyłącznie względem zagranicznych producentów bez sprzedaży w Polsce. Różnica w dopasowaniu oferty może wyjaśniać wynik lepiej niż liczba publikowanych artykułów. Co audyt powinien sprawdzać na Twojej stronie? Audyt powinien sprawdzać dostęp do strony, czytelność treści oraz zgodność informacji o firmie i ofercie. Najpierw usuń przeszkody uniemożliwiające pobranie informacji, a następnie popraw odpowiedzi na pytania klientów. Dla ChatGPT Search szczególnie istotny jest OAI-SearchBot. OpenAI odróżnia go od GPTBot, który dotyczy treści mogących służyć do trenowania modeli. Możesz dopuścić robota wyszukiwawczego i jednocześnie zablokować robota treningowego; są to niezależne ustawienia. Sprawdź oficjalną dokumentację robotów OpenAI, zanim zmienisz robots.txt. Dopuszczenie robota pomaga zapewnić dostęp, ale nie gwarantuje wyboru strony do odpowiedzi. Dostęp robota Sprawdź robots.txt oraz odpowiedzi serwera. Usuń niezamierzoną blokadę. Ochrona serwera Sprawdź logi CDN i zapory aplikacyjnej. Zweryfikuj blokowane żądania. Treść strony Sprawdź, czy opis oferty można pobrać i odczytać. Udostępnij istotne informacje tekstowo. Tożsamość firmy Sprawdź nazwę, kontakt i obszar działania. Ujednolić rozbieżne dane. Oferta Sprawdź parametry, warunki i dostępność. Zaktualizuj informacje produktowe. Podstrony odpowiedzi Sprawdź dopasowanie treści do pytań klientów. Uzupełnij brakującą odpowiedź. W sklepie internetowym opis „nowoczesne biurko do każdego wnętrza” niewiele pomaga przy wyborze. Podaj wymiary, zakres regulacji, udźwig, warunki dostawy i ograniczenia zastosowania. Dzięki temu treść odpowiada na konkretne kryteria, które mogą pojawić się w pytaniu. Dane strukturalne powinny zgadzać się z widoczną treścią. Nie dodawaj opinii, parametrów ani dostępności, których użytkownik nie może
Mandatory Part(26.10.05) Program Name: libft.a Files Required: Makefile, libft.h, ft_*.c A Makefile requires NAME, all, clean, fclean, and re — these work like shortcuts. (And those are: / These are as follows:) 'NAME' is like a bookmark because changing 'NAME' updates all instances of the name at the same time. 'all' is used to package libft.a. 'clean' deletes temporary files (.o files). 'fclean' completely deletes everything (including libft.a). 're' completely deletes everything and then repackages it.
Så skiljer du tekniska hinder från otydliga företagsuppgifter och luckor i innehållet. Av Leander Van Linthout Publicerad 5 oktober 2026 Ditt företag kan saknas i ChatGPT eftersom webbplatsen är blockerad, företagsuppgifterna är otydliga eller innehållet inte besvarar kundens fråga. Det kan också bero på hur du testar: ett svar utan webbsökning säger inte samma sak som ett aktuellt söksvar med källor. Börja därför med att skilja mellan tre problem: företaget känns inte igen, webbplatsen citeras inte eller företaget rekommenderas inte. Kontrollera sedan åtkomst, faktauppgifter och relevanta kundfrågor i den ordningen. Upprepade tester ger ett bättre beslutsunderlag än en enstaka skärmdump, men ingen åtgärd garanterar att företaget väljs i varje svar. Vad betyder det att företaget inte syns i ChatGPT? Det kan betyda att företaget inte känns igen, att webbplatsen inte citeras eller att företaget saknas bland rekommendationerna. De problemen kräver olika åtgärder. Ett omnämnande är när företagsnamnet förekommer i svaret. En citering innebär att en sida används som källa. En rekommendation innebär att företaget föreslås som ett alternativ för kundens situation. Du kan få ett omnämnande utan en citering, och en citering utan att bli rekommenderad. Skilj också mellan svar med webbsökning och svar där ingen sådan sökning har gjorts. Ett svar utan webbsökning är ett dåligt test av om din uppdaterade tjänstesida går att hitta. Kontrollera därför vilket läge du använder och om svaret innehåller aktuella källor. Börja med en fråga om företagsnamnet och orten. Fortsätt med en fråga om tjänsten, utan företagsnamnet. Om företaget hittas i första testet men saknas i det andra finns åtminstone viss information tillgänglig. Då bör du undersöka relevans och jämförbarhet innan du beställer en total teknisk ombyggnad. En frisörsalong i Uppsala behöver exempelvis skilja mellan att bli hittad på sitt namn och att rekommenderas för lockigt hår. Den andra frågan kräver belägg för just den kompetensen. Att hemsidan bara säger ”personlig service” hjälper inte kunden att bedöma den. Vilka är de vanligaste orsakerna? Vanliga orsaker att undersöka är blockerad åtkomst, otydliga företagsuppgifter, otillräckliga svar på köparfrågor och ett missvisande test. Behandla dem som hypoteser tills du har kontrollerat webbplatsen och svarens källor. Företagsnamnet ger fel verksamhet Möjlig orsak: namnförväxling eller gamla uppgifter. Första kontroll: sök med namn, ort och tjänst. Webbplatsen saknas som källa Möjlig orsak: åtkomstproblem eller otillräcklig relevans. Första kontroll: kontrollera crawleråtkomst och frågematchning. Konkurrenter rekommenderas Möjlig orsak: tydligare information för kundens situation. Första kontroll: läs sidorna som faktiskt citeras. Bara varumärkesfrågor fungerar Möjlig orsak: svagt innehåll för kategorifrågor. Första kontroll: granska tjänste- och jämförelsesidor. Resultaten växlar mellan tester Möjlig orsak: olika frågor, sammanhang eller svarskörningar. Första kontroll: upprepa samma frågor i nya chattar. Adress eller öppettider är fel Möjlig orsak: inaktuella eller motstridiga källor. Första kontroll: identifiera källan till uppgiften. Företaget är svårt att identifiera Ett kort namn kan tillhöra flera verksamheter. Ett gammalt företagsnamn kan finnas kvar på katalogsidor. En hemsida kan sakna ort, juridiskt namn eller en tydlig beskrivning av verksamheten. Lösningen är att göra identiteten begriplig. Använd konsekventa uppgifter på startsidan, kontaktsidan och relevanta externa profiler. Förklara ett namnbyte där gamla kunder fortfarande kan hitta den tidigare identiteten. Webbplatsen beskriver företaget men inte köpet ”Vi erbjuder kvalitet och erfarenhet” besvarar inte frågor om prisupplägg, leveransområde eller vilken kund företaget passar. Byt allmänna löften mot sådant som går att kontrollera. En redovisningsbyrå kan ange vilka företagsformer den arbetar med, vilka system den stöder och vad introduktionen omfattar. Publicera också relevanta begränsningar. Ett företag som bara tar företagskunder bör säga det. Frågan testar något annat än din marknad ”Bästa konsultbolaget” säger lite om en lokal specialist. Lägg till kundtyp, tjänst och ort när dessa faktiskt avgör köpet. Gör samtidigt några bredare tester för att förstå skillnaden mellan nischad och generell synlighet. Hur kontrollerar du om webbplatsen är blockerad? Kontrollera OAI-SearchBot i robots.txt och undersök om webbhotellet eller säkerhetstjänsten stoppar dess förfrågningar. En tillåten crawlerregel hjälper inte om brandväggen ändå nekar åtkomst. OpenAI skiljer mellan OAI-SearchBot för sökfunktioner och GPTBot för innehåll som kan användas till modellträning. Inställningarna hanteras separat. Du kan alltså tillåta sökåtkomst och samtidigt neka GPTBot. ChatGPT-User används för vissa användarinitierade besök och är inte samma sak som sökcrawlern. En möjlig konfiguration, om den motsvarar ditt beslut, är: User-agent: OAI-SearchBot Allow: / User-agent: GPTBot Disallow: / Läs hela filen innan du ändrar något. Kontrollera andra regler för samma crawler och att känsliga områden behåller avsedd åtkomstbegränsning. Be utvecklaren kontrollera att servern tillåter OpenAI:s publicerade IP-adresser för sökcrawlern. Kontrollera därefter startsidan och de viktigaste tjänstesidorna. Är de offentliga? Svarar servern normalt? Går huvudinnehållet att läsa utan inloggning, formulär eller en säkerhetsutmaning? Finns oavsiktliga indexeringsbegränsningar? Använd serverloggar för att undersöka verkliga förfrågningar och felkoder. Ett test där du själv byter user-agent kan avslöja vissa problem, men bevisar inte att en förfrågan från crawlerns faktiska nätverk fungerar. Åtkomst gör webbplatsen möjlig att inkludera, utan att garantera placering. Åtgärda därför tekniska hinder först när du har belägg för dem. Om sidorna redan går att hämta behöver nästa undersökning handla om innehållet och frågorna. Hur gör du ett rättvisande synlighetstest? Använd en fast uppsättning realistiska kundfrågor, upprepa dem och dokumentera både omnämnanden och citeringar. Ett lyckat eller misslyckat svar räcker inte som underlag för en större investering. För att bekräfta var problemet finns skulle jag börja med SQSEO. Verktyget kombinerar research av long tail-sökord och AI-sökfrågor med återkommande mätning av varumärkesomnämnanden och citerade sidor. Grundresearchen är gratis; förutsätt inte att varje bevakningsfunktion har samma kostnadsvillkor. Välj frågor från olika steg i köpet Ett illustrativt upplägg för en lokal redovisningsbyrå är: Vad erbjuder [företagsnamn] i Malmö? Vilka redovisningsbyråer i Malmö hjälper små aktiebolag? Vilken redovisningsbyrå passar ett konsultbolag med två anställda? Vad ska jag jämföra innan jag väljer redovisningsbyrå i Malmö? Använd företagsnamnet i identitetstestet, men lämna bort det i kategorifrågorna. Annars hjälper du själv företaget in i svaret och mäter inte spontan upptäckt. Håll förutsättningarna så lika som möjligt Använd nya chattar och samma språk, ort och frågeformulering. Dokumentera datum, tillgängligt modelläge och om webbsökning användes. Tidigare konversationer och personanpassning kan påverka jämförbarheten. Säg att du väljer 12 frågor och kör varje fråga tre gånger. Det ger 36 svar. Om företaget nämns i nio blir omnämnandeandelen 25 %. Det är ett räkneexempel för den valda frågelistan, ingen uppskattning av hela marknaden. Spara också vad svaret säger om företaget. Ett omnämnande med fel adress är inte samma framgång som en korrekt rekommendation för rätt kund. Omnämnandeandel Registrera svar där företagsnamnet förekommer. Det hjälper dig bedöma synlighet i den valda frågelistan. Källhänvisningar Registrera citerade sidor på din domän. Det hjälper dig bedöma vilket innehåll som används. Rekommendationer Registrera när företaget föreslås för kundens situation. Det hjälper dig bedöma relevans för ett möjligt köp. Faktakvalitet Registrera fel om tjänst, ort eller kontaktuppgifter. Det hjälper dig bedöma behovet av rättningar. Hänvisningstrafik Registrera besök som kan hänföras till ChatGPT. Det hjälper dig bedöma trafikutfall från synligheten. Förfrågningar Registrera kontakter med dokumenterad trafikkälla. Det hjälper dig bedöma affärsnytta som går att följa. Vad ska du förbättra på webbplatsen först? Förbättra de sidor som behöver besvara dina viktigaste köparfrågor. Börja med tydliga företagsuppgifter och konkreta tjänstebeskrivningar innan du producerar fler allmänna blogginlägg. Gör erbjudandet möjligt att jämföra Varje viktig tjänstesida bör förklara vad som ingår, vem tjänsten passar och var den erbjuds. Ange hur kunden får en offert eller bokar nästa steg. En vag rubrik som ”Lösningar för din framgång” kan ersättas med ”Löpande bokföring för små aktiebolag i Malmö”. Använd bara formuleringen om företaget faktiskt erbjuder det. Beskriv därefter arbetsflödet, kundens ansvar och de system som används. Publicera begränsningar som hjälper kunden att välja. Om ni inte hanterar internationell moms behöver kunden veta det innan första mötet. Sådana uppgifter gör sidan mer användbar även när inget AI-system citerar den. Besvara nästa fråga direkt Efter tjänstebeskrivningen behöver kunden ofta förstå prisupplägg, leveranstid, förberedelser och alternativ. Skriv korta svar nära rätt tjänst, med tillräckliga detaljer för ett beslut. Skapa inte hundratals nästan identiska sidor för orter där ni saknar verksamhet. Börja med det ni kan beskriva och belägga. En lokal sida bör ha ett verkligt lokalt innehåll. Använd belägg som håller för kontroll Källhänvisningar, statistik och citat har förbättrat synlighetsmått i en forskningsbaserad testmiljö för generativa sökmotorer. Resultatet är ingen garanti för dagens ChatGPT eller för svenska lokala företag. Den praktiska lärdomen är att prioritera kontrollerbara uppgifter framför fler upprepningar av företagsnamnet. Använd verkliga specifikationer, dokumenterade arbetsmetoder och korrekt tillskrivna citat när
📞 구글의 최신 AI 전화 기능 최근 구글이 새로운 AI 기능을 시험하고 있다. 기능 이름은 '콜 포 미(Call for Me)'. 제미나이(Gemini)가 사용자를 대신해 전화를 걸고 업무를 처리하는 기능이다. 예를 들어 제미나이에게 매장에 전화해 특정 상품의 재고가 있는지 확인하도록 할 수 있다. 예약을 잡거나 기존 예약을 확인·변경하는 업무도 가능하다. (전화 포비아 있는 사람에게는 대박 소식일지도...? 전화로 진상 부리는 사람들에게는 강제로 사용하게 하고 싶다) 아직 이용 조건이 까다롭다. 사용자는 미국에 거주하는 만 18세 이상이어야 한다. 그리고 초기 테스트 대상은 미국의 픽셀 11(Pixel 11) 사용자 가운데 제미나이 유료 구독자다. 픽셀 11 2026년 8월 12일에 발표된 구글의 11세대 안드로이드 스마트폰 또 구글 전화 앱의 베타 버전을 사용해야 한다. 📱어떻게 작동하나? '콜 포 미'의 놀라운 점은 전화 이후의 업무까지 AI가 처리한다는 점이다. 예를 들어 "내일 저녁 7시에 두 명 예약해줘"라고 요청하면 제미나이가 업체에 직접 전화를 건다. 통화가 시작되면 제미나이는 상대방에게 자신이 구글의 인공지능 비서임을 밝힌다. 사용자는 제미나이가 통화하는 동안 실시간으로 대화 내용을 확인할 수 있다. 문제가 생기거나 직접 이야기하고 싶다면 통화 중 언제든 사용자가 대화를 넘겨받을 수도 있다. 😟 우려되는 점 금융 거래처럼 돈이 오고가는 행위에는 매우매우 보수적인 설계가 필요하다. 어쩌면 절대 맡겨서는 안 될 지도 모른다. 현재 콜 포 미는 결제나 금융 거래를 수행할 수 없도록 되어 있다. 🤔 나의 생각 AI의 자율권을 행동의 위험도에 따라 단계적으로 나눠야 하지 않을까? 재고 확인이나 영업시간 문의처럼 잘못돼도 피해가 작고 다시 확인하기 쉬운 업무는 AI가 사용자 확인 없이 처리해도 괜찮지 않을까 싶다. 예약 취소나 일정 변경처럼 다른 사람에게 영향을 주거나 복구 비용이 발생하는 행동은 실행 직전에 사용자의 확인을 한 번 더 받는 게 안전하다. 금전적·법적 책임이 발생하는 행동은 더 엄격하게 봐야 한다.
苹果新一代iPhone 18 Pro Max上市仅数周,就出现了较为集中的蜂窝网络连接问题。美国运营商AT&T近日首次通过短信向受影响用户正式发出警告,承认部分iPhone 18 Pro Max设备存在无法正常使用蜂窝网络的问题,并要求用户立即升级至iOS 27.0.1。此前已有大量用户反映手机会突然失去移动网络、无法拨打电话或发送短信,甚至进入“SOS”紧急模式。 阅读全文