Загружаем каталог…
Загружаем каталог…
"Claude는 영상을 직접 볼 수 있나요?" 이런 질문을 자주 받습니다. 결론부터 말하면, 직접은 못 봅니다. Claude가 받을 수 있는 건 이미지와 PDF이고, 영상 파일은 받지 않습니다. Claude Code도 마찬가지입니다. ChatGPT와 Gemini는 영상을 그대로 받을 수 있습니다. 직접 테스트해 봤습니다. 100초짜리 명왕성 해설 영상을 세 AI에게 주고 같은 질문을 했습니다. "이 영상은 무슨 내용이야? 87초 화면에는 뭐가 나와?" ChatGPT : 처리에 1분 15초. 전체 흐름을 맞게 설명했고, 87초에서는 뉴호라이즌스와 하트 모양 지역 Tombaugh Regio를 언급했습니다 Gemini : 영상을 직접 읽고, 87초 화면에 있는 라벨 세 개까지 답했습니다 Claude : 영상을 바로 줄 수 없어서, 먼저 Claude가 읽을 수 있는 형태로 바꿉니다 Claude에게 영상을 "보여주는" 방법 (도구 없이도 가능) 화면이 바뀔 때마다 이미지를 한 장씩 뽑고, 중복은 버린다 Whisper로 받아쓰기를 하고 타임스탬프를 남긴다 이미지와 받아쓰기를 같은 타임라인에 맞춰서 폴더째 Claude에게 준다 이 영상에서는 101장을 뽑아 63장을 남겼고, Mac에서 20초 걸렸습니다. 결과 Claude도 맞혔습니다. 그리고 두 가지가 더 있었습니다. 모든 설명에 어느 이미지의 몇 초인지( frame_055.jpg @87.0s )가 붙는다 화면에 나온 자막과 받아쓰기를 비교해서 잘못 들은 곳 10군데를 찾아냈다 (예: "新型的冰原"은 사실 "心形的冰原", 하트 모양의 얼음 평원) 한계도 솔직하게 적어 둡니다. 이미지 추출은 샘플링이라 빠른 동작은 놓칠 수 있습니다. 받아쓰기는 Whisper에 의존하니 억양이 강한 부분은 틀립니다. 화면에 글자가 있으면 그걸로 보완할 수 있습니다. 매번 손으로 하기는 귀찮아서 이 과정을 명령어 하나로 묶어서 오픈소스로 공개했습니다. pip install claude-real-video https://github.com/HUANGCHIHHUNGLeo/claude-real-video 100초 데모 영상 (영어 내레이션): https://youtu.be/QRuh1oByT3M
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
Claude는 영상을 볼 수 있을까? ChatGPT, Gemini, Claude에게 같은 질문을 해봤다. "Claude는 영상을 직접 볼 수 있나요?" 이런 질문을 자주 받습니다. 결론부터 말하면, 직접은 못 봅니다. Claude가 받을 수 있는 건 이미지와 PDF이고, 영상 파일은 받지 않습니다. Claude Code도 마찬가지입니다. ChatGPT와 Gemini는 영상을 그대로 받을 수 있습니다. 직접 테스트해 봤습니다. 100초짜리 명왕성 해설 영상을 세 AI에게 주고 같은 질문을 했습니다. "이 영상은 무슨 내용이야? 87초 화면에는 뭐가 나와?" ChatGPT : 처리에 1분 15초. 전체 흐름을 맞게 설명했고, 87초에서는 뉴호라이즌스와 하트 모양 지역 Tombaugh Regio를 언급했습니다…
Открыть источник