AI 该怎样"记笔记"?——四种记忆格式与认知科学(二)
掘金
上一篇我们说,Agent 会在对话后提炼出“用户偏好靠窗”这类事实,存进长期记忆。可“存”这个动作,其实大有讲究:
Балл: 57.1Уверенность: 54%
ПодробнееЗагружаем каталог…
НАВИГАТОР ПО ВОЗМОЖНОСТЯМ ИИ
Найдите свой ИИ-инструмент. Бесплатный доступ, пробные периоды и кредиты — в одном месте.
掘金
上一篇我们说,Agent 会在对话后提炼出“用户偏好靠窗”这类事实,存进长期记忆。可“存”这个动作,其实大有讲究:
Балл: 57.1Уверенность: 54%
Подробнее掘金
你有没有过这样的时刻:上周刚跟客服机器人说过“我对花生过敏”,这周它又热情地给你推荐花生酱饼干;昨天让助手帮你订了靠窗的机票,今天再让它订票,它对你的偏好一无所知。
Балл: 57.1Уверенность: 54%
Подробнее人人都是产品经理
Google 凌晨发布 Gemini 4 Argon,19 项测试拿下 14 项第一,单次输出上限从 64K 直接拉到 100 万 token,还首次在 Vals Index 经济价值榜登顶。它已在 Google 内部迁移 C/C++ 到 Rust、优化数据中心内存。本文拆解这份成绩单背后的能力跃迁与分阶段开放策略。 今天凌晨,Google 发布了新一代前沿模型 Gemini 4 Argon,达到了前沿水平 Google CEO Sundar Pichai 第一时间在 X 上发帖,一并贴出了这张成绩总表: Argon 把单次输出上限从上一代的 64K token 提到了 100 万 token。推广期价格是每百万 token 输入 2 美元、输出 10 美元 但需要注意,现在 Argon 还没有全面开放 它会先通过 Google 的 Fairwind 计划交给一批受信任的网络防御者,同时进入美国政府的模型发布前评估流程;之后会从付费 API 用户和 Google AI Ultra 订阅者开始,陆续开放给开发者、企业和普通用户 成绩 总表里,Argon 和 GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5 比了 18 项测试、19 个分项,覆盖知识工作、Agent 编程、机器学习工程、科学与数学、长上下文、电脑操作、多模态理解和网络安全 19 个分项里,Argon 拿下 14 项第一(CWE-bench v1 与 GPT-6 Astra 并列) 。另外 5 项的第一分别是:FrontierSWE v2(GPT-6 Astra,65.5%)、Terminal-Bench 4.0(Claude Opus 5.5,66.4%)、PostTrainBench(Claude Opus 5.5,49.3%)、Terminal-Bench Science 0.1(GPT-6 Astra,68.1%)和 OSWorld-2.0(GPT-6 Astra,72.6%) Argon 的成绩都是通过 Gemini API、在最高思考档位下测的单次结果(pass@1),不做多数投票,也不并行多次采样;其他模型的分数多数取自各家自己公布的数字或公开榜单 编程方面,Argon 在 DeepSWE v1.1 上拿到 77.9%,刷新了这项测试的最好成绩。这项测试考的是真实世界里的长周期软件工程任务,GPT-6 Astra 是 74.1%,Claude Opus 5.5 是 74.2% DeepSWE v1.1:长周期软件工程 Google 的工程师已经在日常工作里用 Argon,从平时的调试,到大规模代码库迁移,再到算法设计。Vibe Code Bench 上 Argon 是 91.9%,其他三家都在 90% 上下 编程之外,Argon 是 Vals Index 上排名第一的模型。Vals Index 覆盖金融、编程、法律和税务工作,每个行业按它对美国 GDP 的贡献加权,用来衡量模型的经济价值。Argon 得分 68.9%,Claude Opus 5.5 是 67.0%,这也是 Gemini 第一次在这个榜单上排第一 Vals Index:按 GDP 加权的综合测评 分行业看,Vals Finance Agent v2 测的是多步骤的金融研究与分析,Argon 拿到 65.4%,比第二名 Claude Fable 5.1 高 6.5 个百分点 Vals Finance Agent v2:金融研究与分析 法律方向用的是 Harvey 的 Legal Agent Benchmark,考长周期的法律研究和文书起草。 Argon 拿到 19.6%,其他三家都没超过 7% Harvey’s Legal Agent Benchmark:长周期法律工作 AutomationBench 是 Zapier 做的测试,看模型能不能在企业核心业务流程里把一件事从头做到尾。Argon 以 51.3% 排名第一,Claude Opus 5.5 是 42.5% AutomationBench:企业工作流自动化 Argon 在需要看图、看视频的知识工作上也比较强,能做专业的图表分析,能从长视频里找到细节,也能根据一系列文档采取行动。长视频理解测试 LVBench 上,它拿到 91.7%,是目前最好的成绩;图表理解 Chartography 是 71.6%长上下文测试 GraphWalks 里,256K 到 100 万 token 的分项,Argon 是 84.2%,GPT-6 Astra 是 71.8%,两款 Claude 在 65% 上下 100 万 token 输出 为了让 Argon 能做更长、更复杂的任务,Google 把它的输出上限从上一代的 64K token 一下子提到了 100 万 token。Google DeepMind 在 X 上这样介绍: 输出余量大了, 模型可以在一条执行轨迹里思考、生成几十万 token,把难题一次做完 ,推理也更深一层 Google 内部在用 Argon 已经在支撑 Google 的内部工作,数千名 Google 员工提到了它在专业编程任务、深度研究和写作质量上的长处。比如: 量子算法优化 :帮量子计算研究员优化关键应用中瓶颈子程序的时空资源(量子比特数 × 门数)。其中一个例子里,它几分钟就把已发表的基线成绩提升了 40% 内存效率 :一组 Argon Agent 分析了整个服务器集群的性能剖析数据,自主找出并实施了 Google 各数据中心的内存优化。已上线的部分释放了超过 300 TiB 内存,预计总共能省下 500 TiB 到 1 PiB 大规模代码迁移 :Argon Agent 正在把 Google 各处的 C/C++ 代码库迁移到 Rust,规模从 re2、libgav1 这类核心库的几万行,到 Fuchsia Zircon 内核的 80 万 行以上。很多系统非常关键,这些重写在上线前都要经过严格的自动化和人工审计、模拟测试和代码审查 libgav1 是 Google 开源的视频解码库。Argon Agent 拿一个现成的 Rust 移植版做起点,跑了很多轮基于性能剖析的实验,研究编译器的输出,写出编译器能自动向量化的安全 Rust 代码,替换掉了 3.2 万行 SIMD 代码 最终得到一个内存安全的视频解码器,速度是原 Rust 移植版的 2.7 倍,解码输出完全一致 ,和高度优化的 C++ 版本更接近了 网络安全 Google 专门训练了 Argon 的网络安全防御能力,它可以自主发现、验证并修补关键软件漏洞。修复漏洞的测试 CWE-bench v1 上,Argon 以 68% 并列第一,延续了上个月 Gemini 3.8 Flash Cyber 在 CWE-bench v0 上的表现 CWE-bench v1 排行榜 发现漏洞方面,Argon 比 Gemini 3.8 Flash Cyber 进步明显。Google 内部的真实漏洞发现测试,覆盖 20 种编程语言的复杂代码库,看模型能否在源代码里扫出已确认的历史漏洞,Argon 是 85.8%,3.8 Flash Cyber 是 71.0%Wiz 的内部渗透测试基准不给源代码,只让模型分析线上运行的网站,Argon 在发现攻击面、找出漏洞、写出概念验证上都超过了 3.8 Flash Cyber,得分 70.9% 对 58.2% 漏洞发现:真实漏洞扫描与 Wiz 渗透测试 Wiz 已经在它的 Scan for Good 项目里用上了 Argon。这个项目免费帮关键公共基础设施找出并修复高风险暴露面。早期测试中,Argon 在全球多家医院使用的医疗软件里发现了一个严重漏洞,会泄露敏感个人信息,此前的前沿模型都没找到 面向受信任的防御者和 Google 内部团队,Argon 会以不带网络安全护栏的版本提供 ,让他们用上完整的漏洞攻防能力。渠道就是 Fairwind 计划,目前有 650 多家合作伙伴,优先面向政府和国家网络安全机构、医疗电信能源金融等关键基础设施运营方,以及核心技术平台合作方可以单独用 Argon,也可以把它接进 Google 的代码安全 Agent CodeMender。使用有不少约束:只能做授权的威胁模拟、逆向工程、恶意软件分析这类防御和学术研究任务;只能给内部的安全、应急响应和渗透测试团队开权限,并记录员工的访问和使用;不能转售或分享访问权限。通过 Gemini Enterprise 托管调用时,支持零数据留存 安全防护 在全面开放前,Google 还在加强四方面的防护: 防滥用 :模型会拒绝帮助网络攻击和化学、生物、放射性、核(CBRN)攻击的请求,同时保留正当的两用科学研究。这次还改进了监测模型内部激活来识别滥用的技术,并由内外部红队用人工和自动化攻击做了鲁棒性测试 防提示注入 :Argon 是 Google 目前抵御间接提示注入最强的模型,在 Gray Swan 的间接提示注入(IPI)测试里排名第一 监测失准 :部署监控 Argon 思维链和行动的机制,发现它为完成任务越出用户意图时,必要时中止执行。训练过程也用了类似的系统监控,并且刻意不把监测结果回灌进训练,避免模型学会规避监控 加固系统 :高风险训练或评估开始前,把沙箱环境隔离并封闭起来 Gray Swan IPI 测的是攻击者尝试多次后,注入攻击成功的比例,越低越好。尝试 15 次时, Argon 的攻击成功率只有 0.7% ,Claude Opus 5.5 和 Claude Fable 5.1 都是 1.0%,GPT-6 Astra 是 8.5% Gray Swan 间接提示注入测试:攻击成功率 Google 还呼吁同行在能力快速提升的这段时间保留推理过程的透明度,让模型的思考过程继续能用来发现和诊断失准问题 价格与上线 Argon 推广期的价格是每百万 token 输入 2 美元、输出 10 美元,缓存输入比输入价便宜 95%。推广期结束后,价格调整为输入 4 美元、输出 20 美元。负责 Google AI Studio 和 Gemini API 的 Logan Kilpatrick 发帖时,特意点出了推广价: 开放节奏上,Google 采取分阶段的做法:先交给 Fairwind 计划里的网络防御者和受信任的测试者,同时参加美国政府自愿性质的发布前模型评估;收集反馈、迭代完防护措施后, 会从付费 API 用户和 Google AI Ultra 订阅者开始,开放给开发者、企业和消费者 Sundar Pichai 在后续的帖子里也提到了这一点: Google DeepMind CEO Demis Hassabis 说,Argon 在关键能力上是一次巨大的进步: 这次的官方博客由 Google DeepMind 高级副总裁、Google 首席 AI 架构师 Koray Kavukcuoglu 署名。他在 X 上引用 Sundar 的帖子时写道,很多人好奇团队在做什么,所以决定尽早分享: 本文由人人都是产品经理作者【赛博禅心】,微信公众号:【赛博禅心】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载 题图来自Unsplash,基于CC0协议
Балл: 56.97Уверенность: 54%
Подробнее人人都是产品经理
很多人学了十几年外语,真正需要开口的时候还是会紧张。Praktika 为这件事做了一群 AI 外语老师,可以在手机上随时开聊。截至 2026 年 9 月,官网宣称已拥有超过 3000 万名学习者,眼下它更在意的是让 AI 记住每一个学生。 今天分享的产品是:Praktika,https://praktika.ai/ 很多人学了十几年英语,背过几千个单词,做阅读理解也没什么问题,但真正到了需要开口的时候,还是会紧张。 尤其是工作之后,突然要参加一场英文面试、接待外国客户,或者在国际会议上介绍自己的项目,才发现过去学过的那些英语,真正能用出来的并不多。 找个真人外教练习当然可以,但价格不便宜,还得提前预约。 更麻烦的是,很多人其实不好意思跟一个陌生人磕磕巴巴地说英语。 一家名叫 Praktika 的公司,专门为这件事开发了一群 AI 外语老师。 你可以在手机上选一个喜欢的老师,随时开始聊天。说错了,它会纠正;不知道怎么回答,它会给提示;一个句子练习十几遍,它也不会不耐烦。 截至 2026年9月,Praktika 官网宣称已经拥有超过 3000万名学习者 。 在2024年5月,它就获得了 3550万美元A轮融资。当时公司披露, 月活跃用户达到 120万,过去 12个月收入接近 2000万美元。 不过,这家公司最近最有意思的变化,并不是虚拟老师的形象做得越来越逼真,而是开始认真解决一个很容易被忽略的问题: AI 老师怎样才能记住每一个学生? 今年1月,OpenAI 发布了一份关于 Praktika 的客户案例,根据案例中的公司数据, 引入新的长期记忆系统后, Praktika 的次日留存提升24%,几个月内收入翻倍。 01 三个移民创业者,想解决学外语不敢开口的问题 Praktika 的联合创始人分别是 Adam Turaev、Anton Marin 和 Ilya Chernyakov。 三个人有相似的成长经历:他们的家庭都曾为了寻找更好的机会移居其他国家。Adam 后来也曾为了工作,在三个国家之间辗转,需要不断适应不同的语言环境。 他们很早就意识到,掌握英语不仅关系到考试成绩,也会影响一个人能否获得更好的工作机会、融入新的环境。 但即使接受过多年的语言教育,他们自己也经历过同样的困境:读写没有太大问题,真正需要在工作会议或者日常生活中使用英语时, 却很难流畅、自信地表达。 三个人并不是第一次创业,在 Praktika 之前,他们共同创办过一家名叫 Cleverbots 的人工智能服务公司,客户包括可口可乐、金佰利和阿斯利康等大型企业,积累了自然语言处理及企业 AI 应用的开发经验。 2022年前后,他们开始把这些技术用于外语教育。 当时的语言学习市场已经有了 多邻国 这样的成熟产品, 但大量移动学习应用仍然围绕背单词、答题和完成课程设计。 用户可以每天在手机上学习十几分钟,却不一定有足够的机会真正开口交流。 Praktika 选择了另一个入口:直接让学生和一个虚拟老师对话。 它最初结合虚拟人物、传统自然语言处理和早期大语言模型,提供可以互动的英语课程。 后来,随着GPT-3.5等模型出现, 虚拟老师逐渐能够摆脱大量预先设计的固定对话, 根据学生的回答自然地接续聊天。 2024年5月,Praktika 宣布完成 3550万美元 A 轮融资,此前它还完成过一轮250万美元种子融资。 当时,Praktika 已经拥有遍布 100个国家的 120万月活跃用户,过去12个月收入接近 2000万美元。 对于一家成立时间不长的消费级 AI 创业公司来说,它已经找到了愿意为产品持续付费的用户。 02 选一个 AI 老师,帮助练习下周要参加的英文面试 Praktika 目前已经不再局限于英语,而是支持西班牙语、法语、日语、韩语、德语等多种语言。 第一次使用时,用户需要告诉系统自己的语言水平、学习目标和感兴趣的话题。 有人只是想出国旅游时能独立沟通,有人希望准备雅思等考试,也有人需要提高工作中的英语表达能力。 根据这些信息,Praktika 会生成个人学习计划,再让用户选择一位自己喜欢的虚拟老师。 老师有不同的形象、口音和性格。 例如,2026年2月推出的 Praktika 4.0,重点升级了 Skye 和 Tama 两位虚拟老师,使用新的生成式动画技术,让人物的动作和表情更加自然。 但人物形象只是入口,真正的使用过程,是围绕用户的实际需求展开对话。 假设你下周有一场英文面试,需要用英语介绍自己过去负责的项目。你不必从第一课的打招呼开始学习,可以直接进入面试练习。 AI 老师会扮演面试官,提出与你的职业目标有关的问题。 你用英语回答,它根据你的表达继续追问。 如果用错了时态、选择了不自然的词语,或者发音不够准确,系统会给出纠正和解释。 练习时实在不知道该说什么, 还可以查看针对当前对话生成的表达提示 。 面试练完之后,你也可以换一个完全不同的场景,例如模拟机场值机、酒店入住,或者与刚认识的外国同事闲聊。 用户还能够调整老师的反馈风格,选择温和、均衡或者更严格的纠错方式。 这种产品解决了语言学习中一个特别现实的问题:即使你知道应该多开口,日常生活中也未必找得到合适的练习对象。 真人老师的时间有限,通常还需要遵循预约好的课程计划。 Praktika 则可以让用户反复练习同一个话题,随时暂停,或者临时改变练习内容。 尤其是准备面试、商务会议这样有明确目标的场景,用户并不一定需要完整学习一套新课程,而是希望在特定时间内,把自己即将说的那些话练熟。 但 AI 能够陪练,并不意味着它已经具备了一名优秀教师的全部能力。 真正的问题是,学生每天说了什么、在哪里犯过错误,老师能不能持续记住,并据此安排接下来的课程。 03 过去的 AI 老师,每次上课都像第一次见面 很多人已经尝试过让 ChatGPT 们充当英语老师。你可以告诉它自己的语言水平,让它模拟面试官,或者帮忙修改英文表达。 一次对话可能非常顺畅,但如果每次开始新课程,都需要重新解释学习目标、当前水平和上次犯过的错误,长期使用就会变得麻烦。 对于 Praktika 这样的教育产品,问题还不止于此。 如果一个学生昨天练习时连续用错了某个时态,今天上课却没有针对性复习; 或者已经熟练掌握了一组商务表达,下次又被安排重复练习, 学生很容易觉得课程没有随着自己的进步而变化。 Praktika 最初依靠课程规则及对话模型控制教学过程。随着用户规模扩大,团队开始把原本集中在同一个模型里的任务, 拆分给不同的 AI 智能体处理。 今年1月,OpenAI 公布了 Praktika 最新教学系统的具体架构。它已经从单一模型转向多智能体协作, 核心由负责课堂对话、学习进度和长期规划的三个部分组成。 案例的全文也分享给大家:https://openai.com/zh-Hans-CN/index/praktika/ 第一部分负责课堂上的即时交流。 学生刚刚说了什么,老师应该如何追问,是否需要换一种解释方法,都由对话智能体处理。 第二部分负责记录学习表现。 它持续分析学生的流利程度、语言准确性、词汇使用情况,以及反复出现的错误。换句话说,系统不仅知道学生完成了哪节课,还试图了解他究竟掌握了什么。 第三部分负责长期教学计划。 它结合学习目标和过往表现,决定下一阶段应该练习什么,哪些知识需要巩固,以及什么时候适合增加课程难度。 这三个部分共享一套长期记忆系统,保存学习目标、个人偏好及过往错误,让每次对话产生的信息能够影响之后的课程安排。 例如,一个正在准备国际公司面试的学生,如果连续几次无法清楚解释自己过去的项目经历, 系统可以在后续课程中继续强化相关表达, 而不是仅仅因为他完成了某一节课程,就自动进入下一个不相关的话题。 这才是 Praktika 引入长期记忆真正要解决的问题: 学生需要的不是一个知道所有英语知识的老师,而是一个知道自己当前最需要练习什么的老师。 04 为什么 AI 老师不能一边听你说话,一边提前回忆? Praktika 的长期记忆还有一个比较特别的设计: 系统在学生完成一次表达之后,再检索与这次发言有关的历史信息。 这听起来只是一个技术细节,但对真实的对话体验很重要。 假设昨天你反复练习过去完成时,今天却在练习时犯了一个与介词有关的错误。 如果系统提前加载了过多昨天的学习内容,老师可能会过分关注之前练习过的语法问题,反而忽略了眼前真正需要纠正的错误。 Praktika 通过在学生说完之后检索相关记忆,让老师能够结合最新的表达,再决定如何纠错、解释和追问。 它并不是每次都把学生过去的全部聊天记录塞给模型, 而是提取与当前教学相关的信息, 减少无关内容对课堂判断的干扰。 此外,语音识别本身也是教学体验的重要组成部分。 外语学习者经常出现发音不标准、说到一半停顿、重新组织句子等情况。 系统需要尽可能准确地理解这些不完整的表达,才能判断学生真正犯了什么错误,而不是把语音识别的失误当成语言问题。 在模型配置上,Praktika 也没有把所有教学任务交给同一个大模型。 公司公开介绍过使用 GPT-5.2 系列模型负责课堂对话和学习表现跟踪,并调用更高推理能力的模型制定长期学习计划,同时根据任务配置不同规格的模型。 这样的架构除了改善课堂体验, 还有成本上的考虑。 即时对话对速度要求很高,学生不可能每说完一句话,就等待很久才得到回应; 而长期课程规划不需要每次发言都重新执行,却可能需要更复杂的分析。把两种任务分开,才有机会兼顾教学效果、响应速度和计算成本。 不过,公司并没有公开不同模型的调用成本、平均每位用户的推理支出,因此还无法判断这种架构具体节省了多少费用。 长期记忆上线后,次日留存提升24%,收入翻倍 对于 Praktika,长期记忆带来的变化,最终需要体现在用户是否愿意继续学习。 今年1月公布的 OpenAI 客户案例披露,在引入新的长期记忆系统后, Praktika的次日留存提升 24%,收入在几个月内翻倍。 但这两个数字需要放在正确的背景下理解。 首先,它们来自 Praktika 与技术供应商发布的客户案例,并非第三方独立研究。 案例没有公开完整的实验分组、样本规模和其他同期产品调整, 因此不能把所有增长都归因于长期记忆。 其次,次日留存衡量的是用户第一天使用之后,第二天是否再次回来。 对于一款语言学习 App 来说,这确实是一个重要指标,但要证明用户形成长期习惯,还需要进一步观察一周、一个月甚至更长时间后的使用情况。 我还找到了一组可以帮助理解 Praktika 增长过程的数据。 2026年1月,联合创始人 Ilya Chernyakov 在产品分析平台 Amplitude 发布的客户案例中透露: 公司 2023年至 2024年的收入增长超过 20倍, 到 2025年,公司累计下载量已达到 1500万次,月活跃用户超过 200万。 而如今,Praktika 官网展示的学习者规模已经超过 3000万。 Praktika 并不是单纯依靠模型升级推动增长。 根据 Ilya 的介绍,公司从早期就使用 Amplitude 跟踪用户行为,并持续测试新功能、对话模型、学习路径以及不同的收费方案 。 这些实验需要回答的问题更具体: 用户完成初始水平测试后,有多少人真正开始第一次对话?哪些课程能促使他们继续开口?不同学习目标的用户,是否应该看到不同的付费方案? 长期记忆之所以值得关注,是因为它让个性化教学从注册时填写的一份学习问卷,变成了贯穿整个使用周期的持续调整过程。 05 每月约 8美元,用户为什么愿意付费? Praktika 主要通过会员订阅赚钱。 它提供有限的免费练习,让用户体验与AI老师对话;付费会员则开放 不限量口语练习、完整的虚拟老师选择、即时纠错、翻译帮助、老师记忆和每日练习挑战等功能。 目前,官网在产品介绍中给出的参考价格约为每月 8美元。公司还提供周付、月付、季付和年付等多种订阅周期。 相较于传统的一对一外语教学,AI 老师可以降低高频练习的成本,而且不需要用户提前预约课程。 Praktika 真正出售的,也不是一套静态的英语教材。 用户为它持续付费, 是为了获得随时可以使用、能够追踪学习进度,并根据自己的实际需求调整课程的口语练习服务。 这一点同时决定了它的商业机会和经营难题。 一方面,长期记忆能够让用户不断积累个人学习记录,课程也越来越贴合自己的情况。 用户换到另一个产品,可能需要重新建立学习计划和个性化档案。 另一方面,越愿意频繁使用产品的付费用户,可能消耗越多语音识别、语音合成以及大模型推理资源。 如果用户可以不限量练习,公司就必须保证订阅收入能够覆盖这些持续发生的成本。 而教育效果又不能单纯用使用时长衡量, 一个学生每天聊一个小时,如果没有真正提高表达能力,再逼真的虚拟老师也很难长期留住他。 这也是为什么 Praktika 除了继续升级对话模型, 还需要不断追踪学生的学习表现,让用户感受到自己确实在进步。 06 AI 外语老师已经不稀缺,记忆也不会永远是竞争优势 Praktika 面对的市场,已经出现了越来越多的竞争者。 例如, Speak 同样以 AI 口语训练为核心。2024年12月,Speak 宣布完成 7800万美元 C轮融资,估值达到 10亿美元。 另一边, 多邻国 也在持续增加 AI 对话功能。它的 Max 会员可以通过视频通话与虚拟人物 Lily 练习口语,并根据用户当前的语言水平调整对话。 Lily 也已经具备记住此前讨论内容、在下一次通话中继续交流的能力。 因此,长期记忆不是 Praktika 独有的技术。随着基础模型能力不断提高,更多公司都可以开发能够记住学生、生成个性化课程的 AI 老师。 Praktika 需要面对的竞争,也不仅来自其他专业外语学习 App。 通用 AI 聊天工具同样可以扮演英语面试官、修改口语表达,甚至为用户生成长期学习计划。 它必须证明,把大模型包装成一款专门的语言学习产品, 确实能够为用户提供足够明显的额外价值。 这里至少有三项现实挑战。 首先,是对外语初学者的识别准确性。 学生的发音可能不标准、句子可能不完整。 如果系统把一段本来正确的表达识别错了,再给出错误的纠正,反而会干扰学习。 公司需要持续改进对不同口音及不流畅表达的理解能力。 其次,是长期记忆的数据管理。 Praktika需要保存学习目标、表达习惯、语言错误等个人信息,才能实现持续的个性化教学。 但记忆越丰富,对隐私保护和数据管理的要求也越高。 最后,依然是教学效果。 次日留存提高、用户练习次数增加,都是有意义的产品指标, 却不能直接证明学生的真实外语能力获得了同样幅度的提升。 07 AI 教育真正需要的,可能是一位愿意持续教你的老师 今年2月,Praktika 推出了 4.0版本,除了重新设计应用界面、升级虚拟老师形象, 还进一步强化了动态学习计划和多智能体教学系统。 从最初让 AI 老师能够自然聊天,到如今尝试记住每个学生的学习过程,它的产品重心正在发生变化。 早期的卖点是,让用户不再需要预约真人老师,随时打开手机就可以练习。 现在,它开始尝试解决下一层问题: 当一个学生连续使用几个月,AI 能否真正理解他已经学会了什么,以及还需要练习什么? 这两件事情之间,存在着非常大的差别。 一个只会即时回答问题的AI老师,可以陪学生完成无数次对话,但如果每次上课都从零开始,它提供的更像是一个方便的口语练习工具。 只有当系统能够持续观察学生的学习过程,记录具体错误,动态调整教学内容,用户才有可能获得一种真正具有连续性的学习体验。 而从 Praktika 已经公布的增长和留存数据来看,这种连续性不仅关系到产品体验,也有机会转化成更稳定的订阅收入。 不过,记住学生只是个性化教学的基础。 随着越来越多的公司具备相同能力,能否准确判断学生的真实水平、合理安排课程,并帮助他们在现实生活中真正用好一门语言,才会成为下一阶段更重要的竞争。 对于那些学了十几年英语,却始终不敢在会议上开口的人来说,他们需要的从来不是一位无所不知的老师,而是一位知道自己哪里不会、愿意陪自己反复练习,并且每次见面都能接着上次继续教的老师。 以上,祝你今天开心。 作者:张艾拉 公众号:Fun AI Everyday 本文由 @张艾拉 原创发布于人人都是产品经理。未经作者许可,禁止转载 题图来自Unsplash,基于CC0协议
人人都是产品经理
AI视频模型正从技术名词变成内容创作的新引擎。本文用红果短剧的爆火切入,手把手拆解文生视频、图生视频、首尾帧等概念,从技术原理到实操技巧,帮你快速上手,看懂行业讨论,独立判断新模型的价值。 2026 年,如果你问身边的朋友:”你知道 AI 视频模型是什么吗?”他可能会摇摇头。 但如果换个问题:”你刷过红果短剧吗?” 那他可就不困了。毕竟谁不想下班后,急头白脸地来一集红果短剧?白天受的气,晚上靠穿越主角逆袭找补回来。嘴上说着”看完这集就睡”,手指已经很诚实地点开了下一集。 不过看得多了,难免也会冒出一个念头:”这剧情,我上我也能编。” 编故事可以,真”拍”出来就没那么容易了。演员从哪找?场景怎么搭?脑海里那段主角推门登场、镜头缓缓推进的画面,又该怎么拍? 这时候,聪明的你就会开始去研究:有没有什么工具,能帮我把脑海里的画面做出来? 一搜才发现,工具还真不少。可灵、海螺、Seedance、名字还没认全,又碰上了文生视频、图生视频、首尾帧、主体参考。一分钟前,你还在构思主角如何逆袭;一分钟后,你已经在研究这些按钮到底有什么区别。 稳住别慌,今天我将带上我的保姆级教学文章,陪你把这些名字和按钮背后的门道捋清楚。 你不需要有技术背景,也不用提前背下那一串英文缩写。带着”我想做一段什么样的视频”这个问题往下看就行。 读完这篇文章,你不一定能成为 AI 视频专家,但你应该能做到三件事:看懂别人在讨论什么、自己动手试的时候不慌、面对新出的模型能自己判断它值不值得关注。 第一章:什么是 AI 视频模型? 1.AI 视频模型是什么? 一句话告诉你,”AI 视频模型”主要指 根据文字、图片、音频、视频,生成或修改视频内容的模型 。 比如,你输入”店员向杯子里倒咖啡”,模型就需要把这句话变成一段具体的视频:店员长什么样,杯子放在哪里,手怎样移动,咖啡怎样流下来。你不需要逐帧画出这些变化,模型会根据你的描述,尝试生成整个动作过程。 但这句描述只交代了”谁在做什么”,并没有说明镜头离人物多远、动作有多快、咖啡店是什么样。为了生成完整的画面,模型还需要自行补充这些细节,而它补充的内容,未必与你的设想一致。 你可能想要杯子的特写,生成的却是店员的全身画面;你希望咖啡缓缓倒入,它却很快完成了动作。因此,要让结果更接近预期,就需要说清楚关键要求,或者提供图片等参考,减少模型自行发挥的空间。 理解视频模型,可以先记住这一点: 你提供创作要求和素材,模型据此生成画面,再由你判断结果、调整要求,逐步接近想要的效果。 2.AI 视频模型大概是怎么”画”出视频的? 可以先把整个过程分成两件事: 训练时学习规律,使用时根据条件生成。 训练时,模型通过图片、视频、文字、音频说明数据,学习外观、动作和语言之间的关联。例如,”倒咖啡”通常涉及容器倾斜、液体流动,以及接收容器中液面变化。这些关联通过训练保存在模型内部的参数里。 用户点击”生成”时,模型会根据输入条件和已经学到的规律,计算出一段可能符合要求的视频。 以采用 扩散或流匹配 方法的生成系统为例,可以把这个过程粗略想象成: 从杂乱的信号出发,经过多次调整,逐渐形成符合要求的内容。 为了减少计算量,许多视频模型会先处理画面压缩后的信息。你可以把它想象成一份供模型使用的”画面编码”:它用数字表示画面中的内容及其变化,模型在这份编码上完成生成,再由专门的解码模块把结果转换成可观看的视频。因此,前面说的”逐渐形成画面”,实际可能发生在这些数字编码中,我们未必能直接看到一张从模糊变清晰的中间画面。 还有一个容易误解的地方:生成过程中的”一步”,不一定对应视频中的”一帧”。模型可能在同一次计算中处理多个时间位置,让这些画面共同调整;也可能分段生成,再利用前面的内容继续往后接。 所以,不能把所有视频模型都理解成”先独立画一张,再独立画下一张,最后拼起来”。这也解释了为什么同一句要求,多次生成可能得到不同结果。你并没有规定画面的所有细节,而生成过程中通常还包含随机性。”店员倒咖啡”可以有很多种合理的演绎,模型未必每次选择同一种。 3.AI 视频模型和图片模型有什么区别? 图片模型主要解决一个瞬间的问题: 这一刻,画面应该是什么样? 视频模型还要解决: 这个画面接下来怎样变化,前后的变化能不能连起来? 仍然以倒咖啡为例。生成一张图片时,只要店员、咖啡壶、杯子和液体在这一瞬间看起来合理,就可能得到一张不错的图。 生成视频时,要求就多了: 手伸向咖啡壶,手指要与壶柄接触。 咖啡壶被拿起来时,壶身不能突然改变形状。 壶嘴倾斜后,液体应当朝杯子流动。 倒完以后,手和咖啡壶还要自然地收回。 每个瞬间都要尽量成立,瞬间之间还要存在合理的联系。 此外,画面变化有时来自主体,有时来自镜头。店员站在原地,镜头绕着他移动,人物的视角、背景的遮挡和物体之间的位置关系也会跟着变化。 因此,视频模型不仅要生成物体的样子,还要处理物体、动作和视角随时间变化的关系。判断视频时,也就不能只挑一张最好看的截图。 4.为什么视频生成比图片生成难得多? 这里的难点不只是”要生成的图片更多”,还在于这些画面彼此牵连。 变化之中,要保留不该变化的东西 店员转过头,脸的角度会变,但应该还是同一个人;杯子被手遮住一部分,再次露出来时,杯柄不应该换到另一边。 画面随时间变化时,外观和结构能否保持合理连续,通常称为 时序一致性 。这里的”一致”并不要求每一帧都一样,而是要求变化有依据。 人物走动时,衣服褶皱变化是正常的;衣服上的口袋突然消失,就可能是问题。 动作连贯,还要符合物体之间的关系 倒咖啡看起来简单,实际上包含倾斜、接触、流动和液面上升等一连串关系。 一段视频可能播放得很顺滑,却出现咖啡穿过杯壁、手没有碰到壶却把壶提起来等情况。 运动流畅和物理规律,这是两回事。 模型能够学到大量与现实规律相关的模式,但生成出一次合理的动作,并不等于它会在所有场景中可靠地遵守这些规律。 看不见的部分,再出现时也要接得上 当咖啡壶挡住杯子,或者人物转身露出背面时,模型需要根据已有条件生成暂时看不见的部分,以及它们重新出现时的样子。 如果输入只有一张正面照片,背面长什么样往往没有唯一答案。这时,生成内容既要合理,又要与已经出现的部分保持联系。 时间越长,需要协调的关系通常越多 从”拿起杯子”发展到”倒咖啡、递给顾客、顾客喝一口”,涉及更多动作、人物和物体状态。前面出现的偏差,也可能影响后面的结果。 同时,更多画面和更复杂的关系通常意味着更大的计算负担。因此,视频的长度、细节、生成速度和稳定性,都是系统设计需要考虑的问题。 这些难点最终会直接影响使用体验:一个片段可能适合做气氛画面,却还不足以承担必须准确展示商品和操作步骤的任务。 5.视频模型的几种技术路线 了解技术路线,是为了看懂模型介绍中的一些关键词。对于大部分初学者,先认识下面几种思路就够了。 a.扩散:学习怎样从噪声中逐步生成内容 扩散模型的一种典型训练方式,是给真实数据逐渐加入噪声,再让模型学习如何从带噪的信息中恢复内容。生成时,则从随机噪声出发,在文字或图片等条件的引导下,逐步形成结果。 用直观的比喻说,就像一幅杂乱的画面逐渐变得可辨认。但起点并没有藏着一段等待”擦出来”的视频,内容是模型在生成过程中形成的。视频扩散模型还需要处理时间上的联系。 b.流匹配:学习从噪声走向内容的变化方向 流匹配也可以用于从噪声生成内容。可以把它理解成:训练模型判断,在从杂乱信号变成目标内容的过程中,每一步应该朝什么方向变化。 它与扩散方法在数学上存在联系,不宜简单理解为两个完全无关的阵营。普通读者只需先记住:它们都可以通过逐步变换来生成内容,但学习和描述这个过程的方式有所不同。仅凭”采用流匹配”,不能断言一个视频模型就一定更快或更好。 c.自回归:根据已有内容,继续生成后面的内容 自回归的核心思路,是利用已经生成的部分,预测接下来的部分。 这里的”部分”可以是视频编码后的信息单元,也可以是画面或片段,不一定是一张完整图片。Google 的 VideoPoet 就展示过把视频等内容编码为序列,再进行自回归生成的路线。 这种思路需要关注一个问题:后面的生成会依赖前面的结果,前面出现的错误可能继续影响后续内容。 这些方法也可以组合使用。例如,整体上按照时间顺序生成片段,而每个片段内部使用扩散方法完成生成。已有研究明确采用了这种自回归与扩散结合的设计。 你还可能看到 DiT,也就是扩散 Transformer 。它主要涉及模型内部处理信息的网络结构,与前面讨论的生成方法并非同一层面的分类,可以和流匹配等方法结合。没有必要把这些名称当成互相排斥的选项。 到这里,最值得记住的是:AI 视频模型在生成一段随时间变化的内容。它既要让画面成立,也要让变化成立。不同技术路线会影响实现方式,但一个模型是否适合你,最终还要看它能接受哪些条件、提供哪些控制,以及能否稳定完成你的任务。 第二章:现在的视频模型能做哪些事,有什么边界? 1.从输入到输出:视频模型究竟在生成什么? 使用视频模型时,你提供的材料大致有两种作用:一是告诉它要生成什么,二是约束生成结果。 比如,”店员倒咖啡”交代了内容;一张店员照片可以约束人物外观;一段动作视频则可能用于参考动作。具体能接受哪些材料、材料能发挥什么作用,要看所选模型和模式。 同一份素材,用途也可能不同。一张咖啡店照片,可以作为视频的开头,也可以只用来参考店内环境;一段已有视频,可以作为动作参考,也可以成为需要修改的对象。 因此,看到”支持图片输入”或”支持视频输入”时,还要接着看: 模型会怎样使用这份素材? 在输出这一块需要分清,有的模型主要生成画面,有的可以同时生成声音。部分模型提供的”原生音频”能力,意味着声音随视频生成过程产生,而不是成片后再由另一个工具补上。 但”有声音”仍然是一个很宽泛的说法。能生成环境声,不等于能准确说出指定台词;能生成对白,也不等于多人对话时不会弄错说话者。对白、环境音、音效、音乐以及口型同步,需要分别确认。 对创作者来说,先想清楚自己需要的是一段画面、一段有声视频,还是一组能够剪在一起的镜头,后面的功能选择才有依据。 2.基础生成能力:从文字或图片”变”出视频 最常见的起点,是文字和图片。 文生视频:用文字描述你想拍的内容 文生视频,简称 T2V(Text-to-Video),就是主要根据文字描述生成视频。 你写给模型的这段要求,也常被称为”提示词”。 例如: 清晨的咖啡店,阳光透过窗户照进来。一位穿深色围裙的店员把咖啡倒进白色陶瓷杯,镜头缓缓靠近杯口。 这段描述同时交代了场景、人物、动作和镜头。模型需要把这些要求组织成具体画面,并补充桌面材质、人物长相等未指定的细节。 如果你还没有确定人物和场景,只想先看看一个创意大概是什么样,文生视频是很自然的起点。但如果必须使用某位人物、某件商品,仅靠文字描述通常难以准确传达全部外观细节,这时就需要图片等参考。 图生视频:先确定画面,再让它发生变化 图生视频,简称 I2V(Image-to-Video),就是以图片作为条件生成视频。 一种常见用法,是把图片作为起始画面,再通过文字描述接下来发生什么。 比如,你已经有一张店员站在柜台前、手边放着咖啡壶的图片,就可以要求: 店员拿起咖啡壶,缓缓向杯中倒入咖啡,镜头保持固定。 这样,你已经交代了人物、环境和大致构图,不必让模型从头决定这些内容。你的注意力可以更多放在”接下来怎么动”。 不过,一张图片只能提供某个角度、某个瞬间的信息。人物转身后的样子、杯子背面的图案,以及被遮住的手部,都可能需要模型继续补充。 提供图片能增加约束,但不能保证整个视频始终与图片中的细节完全一致。 3.进阶生成能力:用参考内容控制视频 如果你要让同一位店员出现在不同场景里,单纯把某张照片作为开头,未必足够。 你可能希望第一段是他在店里倒咖啡,第二段是他站在门口招呼顾客,第三段是他的面部特写。三个镜头的构图不同,但人物应该保持一致。 这就涉及 参考生视频 :让模型提取参考素材中的人物、商品、场景或其他特征,用于生成新的画面。称为 R2V(Reference-to-Video)。 它与常见首帧图生视频的差别,可以这样理解: 作为首帧: 告诉模型”从这幅画面开始”。 作为主体参考: 告诉模型”新画面里要使用这个人物或物体”。 同一张店员照片,在后一种模式中不一定需要出现在视频开头,而是用来约束新镜头中的人物形象。 参考内容还可以不止一种。例如,人物照片提供外观,商品图提供杯子的造型,视频提供动作或运镜参考。文字、图片、视频和音频这些不同形式的信息一起参与生成,通常称为 多模态参考 。 这样你就可以分别告诉模型:人物用照片里的店员,杯子参照商品图,镜头运动参考另一段视频。原本很难用文字说清的长相、造型和动作,现在可以直接用素材表达。不过,不同模型能参考的内容不同:有的主要用于保留人物或商品外观,有的还支持动作、运镜或声音参考,具体要看所选模式。 参考素材提供了依据,但生成结果能保留多少细节,还需要实际检查。比如,同一位店员在正面镜头里很像本人,转到侧面后,五官是否仍然对得上?杯子静止时图案完整,拿起来转动后,图案是否发生变化? 参考生成的目标,是让指定的人物或物体在新的画面中保持可辨认的特征;这些特征在运动和换镜头时能否保留下来,才决定了素材是否真正用得上。 4.过程控制能力:让视频更听你的话 确定”谁出现在什么地方”之后,下一步是控制”事情怎样发生”。 首尾帧与关键帧:指定某些时刻的画面 如果只给一张起始图,后续变化仍有很大的自由度。支持首尾帧的模式,则允许你同时提供开头和结尾,让模型生成两者之间的过程。 例如,第一张图是杯子放在桌上,第二张图是店员把杯子举到胸前。模型需要尝试补出拿杯、抬手的动作。 这相当于规定了起点和终点,但没有决定中间每一步。模型可能自然地拿起杯子,也可能出现手部变化或不合理的过渡。因此,首尾帧能帮助确定画面走向,但不能替代对动作过程的检查。 更进一步的关键帧控制,可以约束中间某些时刻的画面。例如,在支持指定时间位置的模式中,你可以提供一张”店员已经握住杯柄”的图片,作为第 3 秒的关键帧,再提供一张”杯子举到胸前”的图片,作为第 5 秒的关键帧,让模型生成这些画面之间的动作。 你也可以在提示词中安排节奏:”前 3 秒,店员伸手握住杯柄;第 3—5 秒,缓缓举起杯子;之后停留片刻。”这种写法是在用文字描述动作的时间安排,模型能否准确执行取决于其能力;它与上传图片、指定某一时刻画面的关键帧控制有所不同。 运镜与动作控制:分别告诉模型什么在动 “店员走近镜头”和”镜头靠近店员”,最终可能都让人物在画面中变大,但拍摄效果并不相同。 前者主要是人物移动,后者涉及相机移动,背景的透视和遮挡也会发生变化。因此,描述时最好分清主体动作与镜头运动: 店员站在原地,缓缓抬起杯子;镜头从中景向前推进,最后停在杯子的特写。 多镜头:从一个动作发展成一段叙事 一条咖啡店短片可以包含三个镜头:店铺外景、倒咖啡的特写、店员递杯。 实现这类视频,既可以分别生成后去手动剪辑,也可以使用支持多镜头生成的模型;有些平台则会自动拆分分镜,再组织生成过程。这几种方式在界面上都可能表现为”一次提交,得到一条视频”,背后的控制方式却不同。 多镜头的关键不只是发生了切换,还包括切换之后人物是否相同、杯子是否一致、动作能否衔接。部分模型已经提供相关生成能力,但一次生成多个镜头,并不等于整段故事都能按要求完成。 5.编辑与扩展能力:对已有视频进行修改 假设你已经得到一段满意的倒咖啡视频,只想把窗外的晴天改成雨天。如果重新生成整段,人物、动作和构图都可能改变。 视频编辑能力,就是尝试在已有内容的基础上完成修改。 视频编辑:修改目标,同时保留其他内容 常见的编辑任务包括替换背景、增加或移除物体、替换商品,以及调整光照或整体风格。 不过,这些任务的要求并不相同。 把整段视频改成动画风格,允许较大范围的外观变化;只替换杯子上的图案,则要求人物、杯子形状、动作和光线尽量保留。不能因为一个模型会做风格转换,就推断它也能精确完成局部修改。 编辑结果需要同时满足两个条件: 想改的地方改对了,不想改的地方保留下来了。 如果窗外变成雨天,但店员的脸也变了,这次编辑就还没有完整达到要求。 视频延长:让已经发生的动作继续下去 视频延长是在现有片段之后继续生成新内容。例如,原视频结束在店员倒完咖啡,你希望后面接上”放下咖啡壶,把杯子递给顾客”。它需要承接前面的动作、场景和人物状态。 6.能做 ≠ 做得好:当前视频模型的能力边界 看到”支持人物参考””支持多镜头””支持视频编辑”,可以确认模型提供了相应入口。但这些描述还没有回答一个更实际的问题: 你的任务交给它,能多稳定地完成? 可以把能力理解成三个层次: 支持这项功能: 允许输入相应素材,或执行相应操作。 在某些案例中做得好: 已经展示出令人满意的结果。 在你的任务中稳定可用: 经过合理次数的尝试,能够得到符合要求的内容。 这三层不能直接画等号。官方文档可以确认功能范围,样片展示的是具体结果,而稳定性需要结合实际测试判断。 在使用时,尤其需要留意以下几类边界。 第一,多个要求同时出现时,结果可能顾此失彼。 “店员抬起杯子”与”店员准确拿起指定杯子、展示杯身图案、转身、说出台词,同时完成绕拍”,任务复杂度不同。后一种情况需要协调更多条件,不能从单项示例推断整体表现。 第二,外观相似不等于细节准确。 用于表现咖啡店氛围时,杯子上的细小纹样可能不重要;用于商品广告时,杯型、标志和文字都可能是必须保留的内容。同一段视频,在不同用途下会得到不同评价。 第三,声音和画面各自成立,也可能没有配合好。 店员的台词清楚,但口型对不上;杯子已经落桌,碰撞声却晚了一拍。这些问题需要把视频和声音一起检查,不能只确认输出文件里有音轨。 第四,增加提示词不能解决所有问题。 描述不清,可以补充;功能不支持,需要换模式或工具;动作过于复杂,可能需要拆成几个镜头。遇到问题时,先判断原因,比一味的改动要求更有帮助。 这些例子是使用时需要检查的情况,不代表每个模型都会出现同样的错误。具体模型的表现,应当结合版本、输入和重复测试来讨论。 第三章:判断视频模型的能力 1.为什么不能只看”官方样片”? 官方样片可以帮助你了解一个模型能尝试哪些题材、达到过怎样的效果。但一段精彩的视频,通常不能告诉你完整的制作过程。 它可能是一次生成的结果,也可能经过多次尝试和筛选;可能直接使用模型输出,也可能加入了剪辑、配音、调色或其他处理。如果制作方没有说明,仅凭成片很难判断。 例如,一段广告展示了人物转身、商品特写和流畅的镜头切换。你看到的是完成后的效果,却未必知道其中每个镜头生成了多少次,哪些地方被剪掉,又有哪些部分经过修补。 因此,看样片时,可以顺手确认三个问题: 输入了什么? 只有文字,还是提供了人物图、场景图或动作参考? 展示了什么? 完整生成结果,还是截取出来的片段? 经过了什么处理? 是否剪辑、配音、放大画面,或者修补过局部? 官方样片展示了一种已经实现的结果,而你真正需要了解的是: 在自己的素材、要求和预算下,能否得到类似的效果。 同样的判断也适用于博主测评和用户作品。比起一句”这个模型很强”,清楚交代输入、版本、尝试次数和处理过程的案例,更有参考价值。 2.普通用户评价框架:六个核心维度 评价视频时,可以从下面六个方面看。这是一套方便日常使用的检查方法,各项之间会有联系。 1 指令遵循:有没有完成你提出的要求? 指令遵循,指生成结果与输入要求的符合程度。 假设提示词写的是: 店员先把白色杯子放到桌上,再拿起咖啡壶倒咖啡,镜头保持固定。 看结果时,可以把要求逐项对照:杯子是不是白色?动作顺序对不对?咖啡有没有倒进杯里?镜头是否保持不动? 如果画面精致,但店员一直端着杯子,没有完成指定动作,就说明画面表现和指令遵循出现了分歧。 这里尤其要注意动作关系和先后顺序。”有人、有杯子、有咖啡壶”只说明几个元素出现了,不能证明它们按照要求发生了互动。 2 画面表现:画面是否完整,风格是否合适? 这一项既包括容易辨认的画面问题,也包括审美判断。 前者可以检查人物结构、物体轮廓、纹理、文字和边缘。例如,杯柄是否完整,手指有没有与壶柄粘在一起,背景里的桌椅有没有不合理地连成一片。 后者则涉及构图、光线、色彩和风格。咖啡店宣传片可能需要温暖柔和的氛围,商品展示却可能更重视颜色准确和细节清楚。 两类判断最好分开表达: “杯身文字变形”是具体的画面问题;”我更喜欢偏暖的色调”是审美偏好。 另外,输出的分辨率只能说明画面的像素规格,不能直接说明细节是否准确。 3 动作与物理合理性:动得是否自然,关系是否成立? 可以先看动作本身:人物抬手有没有突然加速,行走时脚有没有滑动,物体移动是否出现突跳。 再看动作涉及的关系:手是否真正握住杯子,杯子倾斜后液体怎样变化,物体碰撞后有没有合理反应。 比如,一个球平稳地滚过桌面,运动可能很流畅;但滚到桌边后继续悬在空中,就出现了物理关系的问题。当然,如果要求本来就是魔法场景,判断标准也应随创作设定调整。 4 时序与主体一致性:前后还是同一个人、同一件东西吗? 时序一致性关注画面随时间变化时,外观、结构和场景能否合理延续。主体一致性则更关注人物或物体的身份有没有保持住。 可以观察几个容易暴露问题的位置: 人物从正面转向侧面,五官有没有明显改变? 杯子被手遮住后再次出现,形状和图案是否还对得上? 镜头移动后,背景里的门窗和家具是否保持合理的位置关系? 切到下一个镜头,人物是否仍能被辨认为同一个人? 这一项需要完整播放,毕竟关系到片段能否连接使用,下一节会进一步展开。 5 镜头与叙事表达:镜头有没有把事情讲清楚? 镜头有运动,并不意味着运镜就有效。 如果要求镜头靠近杯子,要看相机是否真的向前移动,画面的透视和遮挡是否合理变化;如果要求跟拍人物,要看主体是否保持在合适的位置,运动是否连贯。 多镜头视频还要看镜头之间的关系。例如,前一个镜头中店员从柜台内递出杯子,下一个镜头应当让观众理解谁接到了杯子,而不是突然换了人物、方向或场景。 在第一个指令遵循维度中我们检查的是”指定的运镜是否执行”,而在这里我们则进一步去看: 运镜和切换是否自然,是否有助于表现动作、空间与情绪。 6 创作可控性:能否按要求调整,并保留已经满意的部分? 前五项主要看视频结果,可控性还需要结合操作过程判断。 例如,第一次生成的人物和动作都很满意,只想把镜头改近一些。调整要求后,模型能否改变构图,同时尽量保留人物与动作?提供首尾帧或主体参考后,结果是否真正受到这些条件约束? 因此,可控性不能仅凭一段成片判断。它需要你尝试提供参考、改变条件或进行修改,观察结果是否朝预期方向变化。 对于有明确交付要求的创作,能否反复调整到位,会直接影响完成作品需要多少时间。 当涉及声音或编辑时,再增加对应检查 六个维度之外,还应根据任务补充检查: 有声视频: 台词是否正确、声音是否清楚、说话者是否对应,口型和声音是否同步,碰撞声等音效是否出现在正确时刻。 视频编辑: 目标修改是否完成,人物、动作、背景等不需要修改的部分是否保留下来。 3.从”变脸”说起:为什么一致性是 AI 视频的一道难题? 你可能见过这样的片段:人物正面看起来没有问题,转头之后却像换了一个人;商品刚出现时形状准确,拿起来展示时,边缘和图案开始变化。 这类问题之所以影响观感,是因为观众会自然地把前后画面理解为同一个人、同一件物体。外观一旦发生没有依据的变化,这种连续感就被打断了。 难点在于,视频中的主体必须一边变化,一边保留身份。 人物转头时,脸的可见轮廓、光照和五官位置都会改变。模型既要生成新的视角,又要让观众仍然认得出这个人。如果输入只有一张正面照片,侧面和背面的信息并不充分,生成过程中还需要补充未展示的部分。 遮挡也会增加难度。杯子被手挡住以后,再次露出的杯柄和图案,需要与前面衔接;跨镜头时,构图、距离和背景一起变化,主体的外观又要继续保持。 所以,”一致性”可以分成几个层次来看: 在判断时也不能把所有变化都当作错误。毕竟侧脸本来就与正脸不同,光照改变也会影响肤色和材质观感。
人人都是产品经理
客户说“需要”,你就埋头开发?在ToB/G领域,需求真假直接决定项目成败。本文从政策、领导、业务、采购四大来源拆解需求本质,教你用沟通与表情识别真伪,避免竹篮打水一场空。 客户说:“这个功能我们很需要,你们能不能做?” 你回去吭哧吭哧做了三个月,产品出来了,客户说:“我们再看看。” 这个场景,每个ToB/G一线人员都遇到过。问题出在哪?出在客户说的“需要”,和你理解的“需要”,根本不是一回事。 真伪需求判别,是所有ToB/G乙方公司前端一线人员的必修课。从销售到售前到产品经理到项目经理,客户说的话带有哪种目的?需求是怎样产生的,又是怎样消亡的?哪些需求要认真对待,哪些要说服客户放弃? 这里面的门道,可以说是做ToB/G业务的命门。伪需求当真的做了,竹篮打水一场空;真需求当假的剔除了,这游戏就没法跟进了。 需求不是大风刮来的。认清了需求的几种来源,就能更有效地区分真伪。而最底层的判读工具,是沟通;最诚实的信号,是客户的表情和语气。坚定程度,几乎就是需求的真度。 下面,我们按需求来源,逐一拆解。 一、政策推动型需求 这是一种在国内甚至全球普遍存在的需求来源,在国内尤为重要。政府部门、事业单位、银行、央企、国企,甚至私企,都逃不出政策(包括法规)的监管和推动。 政策从推动力度上讲,分为强政策和弱政策。 强政策 ,是有明文规定的,有明确开始和截止时间的,有具体指标数字的。举个近几年最经典的例子:信创,尤其是金融信创。政策非常硬——有开始,有截止,有阶段性指标数据,信创替代百分比有检查机制,2027年底全面信创完成有明确指标。这样的政策,是对需求推动力度最大的,一定会产生真需求。这时候对口的乙方公司,就能吃波肉。上市公司的话,利好会直接显现在股价上。 弱政策 ,就是没有明文规定的,口头鼓励的,内部文件不公开的,无明确时间和数字的,或者话题非常宏大、市场需要时间反应和发酵的。也举个经典的例子:AI。关于AI的政策、比赛、补贴很多,新闻也很多,大力鼓励、提倡,但是呢,没有人检查。这种政策,客户那就仁者见仁智者见智了——想要出政绩的、自己也比较新潮的领导,就愿意吃螃蟹,试点试用;保守型领导那就持续观望,谨慎思考。 强政策是“不做不行”,弱政策是“做了更好”。前者产生采购预算,后者产生试点意向。售前要把80%的精力放在强政策上,对弱政策保持关注,但别押注。 政策推动型需求怎么处理?无论如何千方百计都要想办法拿到政策原文。很多企业甚至有专门的政策研究岗,深入研究政策原文,在字里行间找自己公司的立足点,形成方案。这很可能起到雪中送炭的作用,形成非常良性的帮客户解燃眉之急的效果。在国内这个环境下,吃政策饭不丢人,能吃到也是自己的本事。有政策支持,方案也特别好写。 二、领导驱动型需求 这是一种相当充满迷惑性的需求来源,需要仔细辨别。 多数时间,甲方领导拥有更多的信息渠道来源,对业务走向的判断更敏锐,而且时间不充裕。真的走到交流那一步的需求,是他要花时间成本去认真了解的,往往是真需求。这种要持续跟踪,只要他没调走,都有机会落地。 另一种就是拍脑袋了。看到别家有,或者灵光一现的想法,并没有很完整的构思,就传递出来验证验证。但难判断的,不只是领导拍脑袋,还有领导拍完脑袋之后,他下面的处长、科长怎么办。有些人会认真研究,把它变成真需求;有些人会揣摩上意,把它变成一场表演;还有些人会阳奉阴违,拖着不办。你对接的那个人,决定了这个需求的生死。 怎么辨别?看对面说这话时的状态。真判断的人,眼神是定的,语速是稳的;拍脑袋的人,语气是飘的,眼神是游移的。表情和语气,比话本身更诚实。 三、真实业务需求 ToC业务基本完全基于市场需求,但是ToB的业务需求走到落地,中间还有数不清的流程和汇报环节要走。所以其实真实业务需求的转化率,不见得有前面两种高。 这种需求的要义,主要在找对能走起业务流程的部门或者人。比如,分行的业务需求,总行不一定会集采。需要大量分行都有共同的需求,并且总行觉得集采效率更高,综合考虑才可能集采。那就应该尽力在分行推,争取做标杆案例,总行只是保持联络和汇报就行。 这里面用到了干系人管理里的分层管理技术——谁是你的推手,谁是你的听众,谁是你的决策者,分清楚。 四、常规周期性采购需求 实体物品通常有报废周期,专用设备需求更是周期迭代。还是以银行为例,总行入围的产品,通常有1-3年的合同期。到期前半年,为了让合同无缝衔接,总行就会开始组织新一轮招标。这种需求是最硬的,总行也希望安稳续上,让分行随时能够采购。政务、医疗终端也有这样的周期性。 拼进全力挤进一个轮次,话语权就不可同日而语了。这种类型的需求,优先级必须最高,all in。 但all in的前提是:你已经在局中,或者你有足够的差异化优势撕开一个口子。如果两者都没有,那这个周期对你来说不是机会,是陷阱。你需要做的,是提前为下一个周期布局。 写在最后 需求判别,最底层的技术就是沟通,辅助技术是表情分析。 无论是哪种源头的需求,传递人的语气和表情非常重要。坚定程度,几乎就是需求的真度。 如果客户非常坚定,但是依旧分析出来需求是伪的,那么可以拖一拖,冷处理一下,也许伪需求自己就消失了,客户想明白了。 如果是强硬且非常重要的客户,那无论真伪,只要有机会都得抓住,用良好的态度拿到入场券再说。 去伪存真,不是一道非黑即白的判断题,而是一场对人性、对组织、对时机的综合判读。这门功夫,值得每个ToB/G人练一辈子。 本文由 @钟溯/trace 原创发布于人人都是产品经理。未经作者许可,禁止转载 题图来自Unsplash,基于CC0协议
Балл: 56.96Уверенность: 54%
ПодробнееInfoQ - 促进软件开发领域知识与创新的传播
点击查看原文>
Балл: 56.37Уверенность: 54%
ПодробнееInfoQ - 促进软件开发领域知识与创新的传播
点击查看原文>
Балл: 56.36Уверенность: 54%
Подробнееvelog
온라인 엔터테인먼트 시장이 첨단 정보통신 기술과 결합하여 비약적인 성장을 거듭함에 따라 유저들이 접할 수 있는 플랫폼의 종류와 선택지는 이전에 비해 훨씬 넓어졌습니다. 그러나 수많은 플랫폼이 우후죽순 생겨나는 양적 성장의 이면에는 자본력이 현저히 부족하거나 유저의 소중한 예치 자산을 부당하게 취득할 목적으로 개설된 부실 사이트들의 난립이라는 심각한 금전적 위험성이 공존하고 있습니다. 수많은 분석과 전략을 통해 아무리 막대한 당첨 수익을 거둔다 할지라도, 이를 실제 현금으로 안전하고 투명하게 정산받지 못한다면 유저가 투입한 시간과 노력, 자본은 한순간에 수포로 돌아가게 됩니다. 과장된 홍보나 눈앞의 화려한 보너스 혜택에 현혹되지 않고 자산을 안정적으로 보호하기 위해서는 제3의 전문 검증 기관이 실물 자금을 직접 동결하여 금전 피해를 담보하는 시스템의 구조적 이점과 작동 메커니즘을 정밀하게 진단하고 활용하는 지혜가 필수적입니다. 안심할 수 있는 이용 환경을 구축하기 위해 필수적으로 체크해야 할 핵심 지표들을 아래에서 상세히 분석해 드립니다. 목차 베팅 생태계의 재정적 불확실성과 실물 담보 체계의 필요성 사전 예치금 제도의 작동 구조와 피해 즉시 보상 메커니즘 플랫폼의 자본 건전성 및 대규모 당첨금 정산 유동성 진단 최첨단 서버 통신 암호화 및 네트워크 보안 인프라 검증 자의적 규정 적용을 차단하는 약관 독소 조항 사전 포착 집단지성 빅데이터 모니터링 기반 실시간 평판 추적 정품 오리지널 게이밍 솔루션 연동 및 결과값 공정성 확인 24시간 실시간 입출금 인프라 및 고객지원 응답성 평가 자주 묻는 질문 (FAQ) 정교하게 동결된 안전 보호막 위에서 완성되는 안심 플레이 1. 베팅 생태계의 재정적 불확실성과 실물 담보 체계의 필요성 초고속 모바일 네트워크와 스마트 단말기의 보급으로 언제 어디서나 게이밍 플랫폼에 접속할 수 있는 편의성이 확보되었지만, 기술적 및 재정적 검증을 제대로 거치지 않은 부실 업체들 또한 대거 난립하는 결과를 낳았습니다. 대다수의 자금 피해 사례는 플랫폼의 재정 구조나 과거 정산 이력을 다각도로 검증하지 않은 채, 시장 평균치를 지나치게 상회하는 보너스 비율이나 과장된 이벤트 문구에 현혹되어 가입하면서 발생합니다. 아무리 우수한 전략으로 높은 당첨금을 달성한다 할지라도 이를 신속하고 투명하게 정산받지 못한다면 모든 노력은 무용지물이 됩니다. 따라서 플랫폼 선택 시 단순한 혜택보다는 정산 안정성을 물리적으로 담보해 줄 수 있는 실물 보증 체계의 존재 여부를 최우선 진단 지표로 설정해야 합니다. 2. 사전 예치금 제도의 작동 구조와 피해 즉시 보상 메커니즘 온라인 게이밍 환경에서 유저의 자산을 가장 확실하게 보호하는 핵심 안전장치는 바로 제3의 검증 기관에 사전 동결하는 예치금 시스템입니다. 이 시스템은 대상 플랫폼이 검증 기관에 일정 규모 이상의 실물 보상용 자금을 사전에 입금하고, 해당 금액을 동결 상태로 유지하도록 조치하는 방식으로 구동됩니다. 이러한 체계가 갖춰지면 만에 하나 플랫폼 측에서 예기치 못한 정산 지연이나 불합리한 사유로 환전을 거부하는 분쟁이 발생하더라도 제3의 기관이 즉각 개입합니다. 정밀 조사를 통해 이용자의 정당한 게임 및 베팅 내역이 확인되는 순간 동결되어 있던 예치 자금에서 피해액을 즉시 100% 보상하므로, 유저는 어떠한 상황에서도 원금과 당첨 손실 위험으로부터 완벽히 보호받게 됩니다. 3. 플랫폼의 자본 건전성 및 대규모 당첨금 정산 유동성 진단 사이트가 환전 지연 없이 안정적인 서비스를 지속적으로 제공할 수 있는가를 결정짓는 가장 근본적인 기준은 막강한 자본력과 끊김 없는 자금 유동성 확보 여부입니다. 스포츠 경기나 라이브 게임 결과는 특정 시점에 대형 당첨자가 일시에 몰릴 수 있어 자체 자본의 깊이가 얕은 곳은 불어난 정산 요청을 감당하지 못하고 서비스 중단이나 횡령을 선택하게 됩니다. 넉넉한 재정적 유동성을 확보한 우수 플랫폼은 대규모 정산 요청이 동시에 들어오더라도 지체 없이 신속하게 환전 절차를 완료하는 정산 인프라를 가동합니다. 반면 자본 구조가 취약한 중소형 업체는 말도 안 되는 시스템 오류나 추가 인증을 핑계로 정산을 미루다가 회원 자격을 일방적으로 박탈하곤 합니다. 이에 따라 사전에 예치금을 동결해 둔 검증된 안전놀이터 파이프라인을 선별하여 활용하는 것이 최우선 과제입니다. 4. 최첨단 서버 통신 암호화 및 네트워크 보안 인프라 검증 기술적인 관점에서 대상 플랫폼의 신뢰성과 안정성을 측정하는 핵심 기준은 서버 인프라의 보안 수준과 도메인 유지 이력입니다. 단기간에 금전적 이익만을 취하고 서비스를 폐쇄할 목적으로 만들어진 미검증 업체들은 대체로 생성된 지 불과 몇 달 되지 않은 신규 도메인을 사용하며 기술적 보안 설정이 매우 취약하다는 공통점이 있습니다. 반면 수년간 아무런 불미스러운 사고 없이 안정적인 서비스를 유지해 온 메이저 사이트들은 최신 SSL(Secure Sockets Layer) 암호화 통신 프로토콜을 가동하여 사용자의 개인정보와 금융 거래 데이터를 철저히 보호합니다. 이에 더해 해외 전문 IDC 센터를 경유하는 디도스(DDoS) 방어 전용 장비와 분산 서버 시스템을 구비하고 있으므로, 도메인의 등록 시점과 서버 통신 보안 상태를 엄격하게 점검하는 작업이 우선되어야 합니다. 5. 자의적 규정 적용을 차단하는 약관 독소 조항 사전 포착 실제 자금 피해 제보 내역을 면밀히 분석해 보면 악의적인 불량 사이트들은 이용자에게 불리하게 작동하도록 애매하게 작성된 독소적 약관 조항을 자주 악용합니다. 가입 초기에는 세부 제한 조항을 명확히 공지하지 않다가, 유저가 게임에서 승리하여 환전을 요청할 때 비로소 불명확한 제재 문구를 적용하여 정산을 거부하는 패턴입니다. 롤링 요구 비율의 타당성: 보너스 지급 시 요구되는 롤링 비율이 실제 달성 가능한 합리적인 범위 내에 있는지 사전 점검합니다. 제재 조항의 구체성: 특정 분석 기법이나 이용 패턴에 대해 운영진의 자의적 해석에 남용되지 않는지 검토합니다. 약관의 소급 적용 금지: 베팅이 완료된 이후 사후에 변경된 규정을 적용하여 이용자에게 불이익을 주지 않는지 확인합니다. 고객 지원 기록 보존: 명확하지 않은 조항이 존재할 경우 가입 전 1:1 상담을 통해 명확한 지침을 확답받고 해당 대화 내역을 저장해 둡니다. 모든 운영 지침과 규정이 객관적이고 투명하게 공지된 플랫폼만을 선택하는 것이 불합리한 당첨금 몰수 피해를 막는 확실한 방어선이 됩니다. 6. 집단지성 빅데이터 모니터링 기반 실시간 평판 추적 개인 이용자 혼자의 힘으로 특정 플랫폼의 전체 서버 이력, 과거 도메인 변경 내역, 비공개 분쟁 사건을 모두 추적하는 데에는 명확한 한계가 존재합니다. 따라서 신뢰성 높은 정보 자료를 신속히 확보하기 위해서는 수많은 실제 이용자들의 경험담과 사고 제보가 실시간으로 수집되는 전문 보증업체 빅데이터 모니터링 시스템을 활용하는 집단지성의 방식이 매우 효율적입니다. 이러한 정보 공유 네트워크 공간에서는 실제 사용자가 경험한 입출금 정산 속도, 시스템 장애 발생 시 운영진의 대처 방식, 예고 없는 약관 변경 사례 등 플랫폼 생태계의 실제 모습이 반영됩니다. 이용을 고려 중인 사이트의 상호나 도메인 주소를 통합 검색하여 과거 불미스러운 피해 분쟁 사례가 한 건이라도 기록되어 있는지 사전에 체크하는 습관이 중요합니다. 7. 정품 오리지널 게이밍 솔루션 연동 및 결과값 공정성 확인 카지노 및 슬롯 계열의 게임 서비스를 제공하는 플랫폼을 평가할 때는 영상 수급 과정의 투명성과 무작위 숫자 생성기(RNG) 시스템의 공정성이 담보되어 있는지 점검해야 합니다. 검증된 우수 플랫폼들은 에볼루션, 프라그마틱 등 세계적으로 인정받는 글로벌 오리지널 게이밍 솔루션사와 정식 계약을 체결하여 정품 게임 소프트웨어를 수급합니다. 반면 신뢰성이 부족한 불량 업체는 승률 조작이 가능한 녹화 영상을 실시간 화면처럼 속여 송출하거나, 결과값을 임의로 조정할 수 있는 카피 프로그램을 무단 탑재하여 유저에게 손실을 유발합니다. 정식 정품 검증 절차를 거치지 않은 엔터테인먼트 소프트웨어는 승률의 공정성을 신뢰할 수 없으므로, 정식 라이선스를 보유한 글로벌 제조사의 정품 게임 영상과 결과값이 정상 출력되고 있는지 정밀 분석해야 합니다. 8. 24시간 실시간 입출금 인프라 및 고객지원 응답성 평가 플랫폼 운영진의 정직함과 서비스의 질적 수준을 가장 직관적으로 증명하는 지표는 입출금 정산 처리의 속도와 24시간 실시간 고객 지원 체계입니다. 정직하고 투명하게 운영되는 곳은 유저의 정당한 환전 신청에 대해 불필요한 증빙 서류를 반복 요구하거나 정기 점검을 구실로 무기한 처리를 지연시키지 않습니다. 본격적인 대규모 플레이를 진행하기 전 소액 자금을 활용해 입출금을 미리 진행해 보면서 정산 시스템의 반응 속도를 직접 체크해 보는 단계적 조치가 안전합니다. 정상 진단을 거친 사이트 이용 시 환전 신청 후 안내된 정해진 시간 이내에 차질 없이 정산이 완료되는지, 실시간 고객 상담 채널을 통해 친절하고 전문적인 가이드가 제공되는지 모니터링해야 합니다. 자주 묻는 질문 (FAQ) Q1. 보증금 예치 시스템이 적용된 플랫폼을 이용하면 환전 사고 시 100% 보상받을 수 있나요? 네, 그렇습니다. 제3의 전문 검증 기관에 실물 예치금이 정상적으로 동결된 업체를 이용할 경우, 플랫폼의 갑작스러운 운영 중단이나 부당한 환전 거부가 발생하더라도 사전에 예치된 보증금 자산에서 피해 금액 전액을 즉시 보상받을 수 있습니다. Q2. 보증 시스템을 갖춘 업체를 이용할 때 이용자가 주의해야 할 점이 있나요? 반드시 지정된 공식 보증 안내 링크 및 코드 파이프라인을 통해 가입을 완료해야 합니다. 공식 경로가 아닌 임의의 마케팅 링크나 서드파티 경로로 가입할 경우, 검증 기관의 예치금 보상 대상 회원 목록에서 누락되어 만일의 사고 발생 시 보상 혜택을 받지 못할 수 있습니다. Q3. 안전한 베팅 공간을 선별할 때 최우선으로 검토해야 할 단 하나의 기준은 무엇인가요? 가장 핵심적인 단 하나의 기준은 바로 '객관적으로 증명된 자본력과 예치 보증금의 실제 존재 유무'입니다. 자본력이 건실하여 신속한 정산을 보장하고, 만일의 사태에 대비해 제3의 기관에 피해 보상용 실물 보증금을 동결해 둔 곳이라면 정산과 관련된 대부분의 위험 요소로부터 유저의 자산을 완벽히 지켜낼 수 있습니다. 정교하게 동결된 안전 보호막 위에서 완성되는 안심 플레이 온라인 베팅 플랫폼을 안심하고 즐기기 위한 본질은 자극적인 혜택이나 화려한 광고 문구에 휘둘리지 않고, 객관적인 검증 지표와 투명한 정산 프로세스를 바탕으로 플랫폼을 냉철하게 판별하는 것입니다. 서버 보안 인프라, 자본 건전성, 도메인 운영 이력, 그리고 실제 이용자들의 객관적인 평판을 종합적으로 검토하여 위험 요소를 선제적으로 차단해야 합니다. 이러한 체계적인 검증 과정을 통과한 안심 공간을 선별하고, 사전 예치 보증금이 확보된 안전한 보호막 위에서 스스로의 이성적인 자금 관리 수칙을 준수할 때 비로소 자산 손실에 대한 불안감 없이 온전히 게임 본연의 즐거움을 만끽할 수 있습니다. 세심한 사전 조사와 이성적인 이용 습관을 바탕으로 언제나 쾌적하고 안심할 수 있는 최고의 엔터테인먼트 환경을 완성해 가시길 바랍니다.
velog
Finding comfortable denim that flatters your unique body shape often requires trying on dozens of rigid pairs before making a final decision. Many shoppers eventually crave a reliable silhouette that provides absolute comfort while maintaining a stylish vintage aesthetic. Beautiful pilcro jeans offer the exact balance of premium stretch and classic visual appeal. The style editors at Editorialist frequently recommend this specific brand for anyone wanting to look effortlessly polished during busy weekend outings. You will quickly understand why these specific pants remain a permanent staple in stylish closets around the world. Pilcro jeans fabric technology and unique design details Creating a beautiful everyday pant requires incredible skill and very soft luxury materials sourced from the best fabric mills. Authentic pieces like pilcro barrel jeans usually feature premium cotton blends that feel amazing against your bare skin from the very first wear. Crafters spend hours making sure the metallic hardware and distinctive pocket stitching sit perfectly without causing any irritation. Every small detail reflects a deep commitment to lasting quality and charming visual appeal. Your legs will definitely appreciate the thoughtful construction and beautifully finished hems after a long day of walking around town. The interior construction plays a massive role in how these garments feel during busy daily routines. Innovative stretch technology offers subtle flexibility that makes sitting for extended periods much more bearable than wearing traditional stiff denim. Investing in high quality pilcro jeans means your favorite clothing staple will survive daily wear and constant washing perfectly. Your daily morning routines will become much more enjoyable when you completely trust your clothing choices. Styling your versatile denim for casual and elevated settings Integrating this comfortable aesthetic into your regular rotation takes very little effort or planning on busy mornings. You can easily pair your denim with a flowing floral blouse for a romantic weekend brunch date. Adding oversized sunglasses and a simple leather tote creates a highly polished aesthetic perfect for a relaxed city environment. If you want to transition your outfit for a casual evening dinner a sleek silk camisole works beautifully. This extreme versatility proves that comfortable luxury clothing deserves a permanent spot in your travel luggage. Many people falsely believe that relaxed vintage inspired denim only works for highly casual daytime events. Modern fashion rules highly encourage wearing these rich textured fabrics throughout the busy evening hours as well. Pairing your pilcro jeans with a sharp tailored blazer and pointy toe heels creates a stunning nighttime outfit. The bright indigo washes pop beautifully against dark fabrics and heavy seasonal knits making your outfits incredibly unique. Finding the proper fit and caring for your premium garments Getting the exact right fit is very important when you buy fitted clothing for heavy daily use. A proper fit ensures the waistband stays comfortably secure preventing any awkward adjusting while walking. Most shoppers find that trying on different silhouettes helps them discover exactly what flatters their personal body type best. The premium stretchy fabrics will slowly mold to your unique proportions over time creating a highly custom fit. Taking time to find the correct size ensures you can wear them comfortably from morning until late at night. Keeping your denim looking completely brand new requires a very simple daily care routine. You should always wash your garments inside out in cold water to prevent accidental shrinking or color fading. Keeping them away from harsh standard fabric softeners ensures the material retains its essential stretch properties over time. Hanging your pieces to dry naturally prevents unwanted pilling and extends the lifespan of the woven material significantly. Adding this reliable staple to your collection brings immediate sophistication to all your future casual adventures. This versatile brand gives you a wonderful opportunity to look highly polished while keeping your body entirely comfortable. Leaving behind uncomfortable stiff pants means you confidently embrace physical freedom without losing any personal style. Embracing beautiful pilcro jeans means choosing a lifestyle where you never have to sacrifice personal aesthetics for basic comfort. Your daily outfits will become much more exciting with these timeless pants waiting in your closet. View more: https://editorialist.com/shop/pilcro/women/jeans/
velog
한국과 일본은 지리적으로도 가깝고, 한류 콘텐츠를 오래 나눠 온 이웃이다. 그런데 최근 일본인들의 한국 방문이 단순한 '가까워서'를 넘어선, 뚜렷한 흐름으로 자리 잡고 있다. 일본의 공공 데이터와 한국 관광 당국의 조사를 바탕으로, "일본인이 한국을 찾는 이유"를 5가지 숫자로 정리해 봤다. 1. 일본인 해외여행 4명 중 1명 이상이 한국을 찾는다 문화체육관광부와 한국관광공사에 따르면, 올해 1~7월 해외로 출국한 일본인 813만 6천 명 가운데 한국을 방문한 사람은 228만 명으로 28.0%를 차지했다. 이는 일본인 해외여행객이 가장 많이 찾는 국가로, 지난해 같은 기간 24.6%보다 3.5%포인트 높아진 역대 최고치다. 미국(13.1%), 대만(9.4%), 태국(6.8%)을 모두 크게 앞선 수치다. 2. 방문 결정의 1순위 이유는 '음식'이다 한국관광공사의 2024 잠재방한여행객 조사에서, 일본인 관광객이 한국 방문을 결정한 가장 큰 요인은 '현지의 맛있는 한국 음식'으로 45%를 차지했다. 같은 응답을 한 외래객 평균(32.8%)보다 월등히 높은 비율로, 일본인의 '미식여행' 성향이 숫자로 확인된다. 3. 양국 간 여행객이 1,100만 명을 넘어섰다 2024년 한국과 일본 사이를 오간 여행객은 1,100만 명을 넘어섰다. 이는 양국이 외교 관계를 수립한 1965년 당시 약 2만 2천 명과 비교하면 500배에 가까운 성장이다. 항공 노선 확대와 문화 교류가 쌓이면서, 두 나라가 서로에게 '가장 자연스러운 여행지'가 된 셈이다. 4. 방한 일본인 증가세가 가파르다 올해 4월까지 한국을 찾은 일본인 관광객은 104만여 명으로, 지난해 같은 기간보다 16% 이상 늘었다. 문체부는 한일 항공 공급 확대, K컬처 인기, 환율 등을 성장 요인으로 분석한다. 방한 외국인 전체도 올해 1~7월 1,280만 명으로 전년 동기 대비 21.3% 증가하며 함께 커지고 있다. 5. '음식 여행'을 지역으로 넓히고 있다 한국관광공사는 일본인의 방한 선호 1순위인 음식을 활용해 지역 여행으로 연결하는 캠페인을 진행 중이다. 수원 왕갈비, 대구 막창, 춘천 닭갈비, 전주 막걸리, 광주 떡갈비 등 지역 대표 음식을 일본인 관광객이 더 쉽게 즐길 수 있도록 접근성을 높였다. 수도권에 집중된 수요를 지역으로 나누고, 지역 경제를 살리려는 시도다. 정리하면, 일본인의 한국 방문은 이제 일시적인 붐이 아니라 구조적인 흐름이다. 해외여행 4명 중 1명 이상이 한국을 선택하고, 그 선택의 중심에 음식이 있다. 숫자가 보여주는 방향은 분명하다. 두 나라가 서로에게 점점 더 가까워지고 있다는 것. (이 글은 문화체육관광부·한국관광공사 보도자료(연합뉴스 2026.08 인용), 한국관광공사 2024 잠재방한여행객 조사·2025 지역특화음식 캠페인(이코리아), Travel And Tour World의 공개 데이터를 요약·번역한 것입니다.)
Балл: 54.4Уверенность: 49%
Подробнееvelog
이번 한 주간 "안아수달" 프로젝트 백엔드(anasudal_BE)와 프론트엔드(anasudal_FE)는 서비스의 핵심 기능 개발과 인프라 안정화에 집중했다. 특히 백엔드는 초기 인프라 비용을 대폭 절감하고, 배포 과정을 간소화하며, Gemini API의 안정성을 높이는 데 주력했다. 안아수달 서비스 소개 안아수달은 아이 발달이 걱정될 때, 검증된 공공 자료로만 확인해볼 영역을 찾아주고 가까운 발달재활 기관을 추천하는 서비스다. 부모가 아이의 발달 상황을 입력하면, 시스템은 1,473개의 지식 조각에서 월령에 맞는 근거를 찾아 Gemini가 답변을 생성하고, 그 근거 안에서 확인해볼 치료 영역을 뽑아 전국 2,866곳 중 해당 영역을 다루는 기관 3곳을 추천한다. 진단 대신 '확인해볼 영역'을 안내하며, 로그인 없이 대화 원문을 저장하지 않아 개인 정보를 보호하는 것을 원칙으로 한다. 인프라 비용 절감과 배포 안정성 확보 이번 주 작업의 가장 큰 줄기는 인프라 비용 절감과 배포 과정의 안정화였다. 초기 AWS 인프라는 월 94달러의 비용이 발생했는데, 이를 해커톤 검증용 최소 비용 수준인 24달러로 낮추면서도 핵심 요구사항(ECR, ECS, EC2, SSM)을 유지하는 것이 목표였다. 문제: 높은 인프라 비용과 복잡한 배포 과정 기존 인프라는 ECS Fargate, RDS PostgreSQL, ElastiCache Redis를 각각 독립적으로 운영하여 월 94달러의 비용이 들었다. 또한, 배포를 위한 IAM 사용자 생성 과정이 복잡했고, 수동으로 키를 입력해야 하는 불편함이 있었다. Windows PowerShell 환경에서는 스크립트 호환성 문제도 발생했다. 기존 계정에 다른 프로젝트( syak )가 있어 리소스 간의 의도치 않은 간섭 가능성도 배제할 수 없었다. HTTPS 미적용으로 프론트엔드와의 통신에 제약이 있는 점도 개선이 필요했다. 판단: 단일 EC2 인스턴스 기반의 통합 환경 구축 비용 절감과 배포 편의성을 동시에 잡기 위해, 단일 EC2 인스턴스 위에 모든 백엔드 구성 요소를 통합하는 방향으로 전환했다. ECS 시작 유형 변경: Fargate를 EC2 시작 유형으로 변경하여 게이트웨이 인스턴스가 컨테이너 인스턴스 역할을 겸하게 했다. 데이터베이스 및 캐시 통합: RDS와 ElastiCache를 제거하고, pgvector/pgvector:pg16 및 redis:7-alpine 컨테이너를 EC2 인스턴스 위에서 실행했다. 데이터는 EBS의 /var/lib/anasudal 에 저장하여 영속성을 확보했다. NAT Gateway 제거: EC2 인스턴스가 퍼블릭 서브넷에서 EIP를 통해 직접 외부와 통신하므로 월 43달러에 달하는 NAT Gateway를 제거했다. 보안 그룹 간소화: 프라이빗 서브넷과 API/DB 보안 그룹을 제거하고, 외부에 열린 포트는 80/443만 유지했다. AMI 교체 및 리소스 증설: ARM 기반 t4g.micro 인스턴스를 t3.small (2GB) x86 ECS 최적화 AMI로 교체하여 Postgres, Redis, API를 안정적으로 운영할 수 있도록 했다. 루트 볼륨도 8GB에서 30GB로 확장했다. HTTPS 적용: CloudFront를 앞에 두어 도메인 없이 *.cloudfront.net HTTPS를 얻도록 구성했다. 캐시는 끄고 모든 헤더와 쿼리를 오리진(EC2)에 넘겼다. 배포 과정의 편의성과 보안을 위해 IAM 정책을 강화하고 부트스트랩 스크립트를 개선했다. 프로젝트 전용 IAM 사용자: anasudal-deploy IAM 사용자를 생성하고, anasudal-* 이름 규칙과 Project=anasudal 태그를 따르는 리소스만 접근하도록 권한을 분리했다. 기존 syak 프로젝트의 리소스는 ARN을 명시하여 하드 차단하고, 태그 없는 타 리소스에 Project 태그를 붙여 보호를 해제하는 행위도 Deny 정책으로 막았다. 간소화된 부트스트랩 스크립트: login.sh (Linux/macOS) 및 login.ps1 (Windows PowerShell) 스크립트를 통해 루트 액세스 키 두 줄만 입력하면 IAM 사용자 생성부터 키 등록, 권한 점검까지 자동으로 처리되도록 개선했다. 특히 Windows 환경에서는 .csv 파일이나 메모장 경로를 입력받아 키를 자동으로 파싱하고, 터미널 붙여넣기가 어려운 상황에 대비했다. 배포 문제 해결: systemd 교착 상태 해결을 위해 systemctl restart ecs 호출을 --no-block 으로 변경했고, ec2:DisassociateAddress 동작이 태그 없는 ENI에 적용되어 배포를 막던 IAM Deny 정책도 수정했다. 변경 전/후: 간소화된 인프라와 자동화된 키 입력 1. (BE) 인프라 분리 및 보호 IAM 정책 ( infra/iam/anasudal-deploy-infra.json ) 기존 프로젝트 리소스에 대한 접근을 명시적으로 거부하고, anasudal 프로젝트 리소스만 관리할 수 있도록 IAM 정책을 강화했다. { "Version": "2012-10-17", "Statement": [ { "Sid": "NetworkAndDataPlane", "Effect": "Allow", "Action": [ "ec2:*", "rds:*", "elasticache:*" ], "Resource": "*" }, { "Sid": "DenyTouchingOtherProjects", "Effect": "Deny", "Action": [ "ec2:TerminateInstances", "ec2:StopInstances", "ec2:RebootInstances", "ec2:DeleteVpc", "ec2:DeleteSubnet", "ec2:DeleteSecurityGroup", // ... (중략) ... "rds:DeleteDBInstance", "rds:StopDBInstance", "rds:RebootDBInstance", "rds:ModifyDBInstance", "rds:DeleteDBSubnetGroup", "rds:DeleteDBParameterGroup", "elasticache:DeleteCacheCluster", "elasticache:ModifyCacheCluster", "elasticache:DeleteCacheSubnetGroup" ], "Resource": "*", "Condition": { "StringNotEqualsIfExists": { "aws:ResourceTag/Project": "anasudal" } } }, { "Sid": "DenyAccountWideDamage", "Effect": "Deny", "Action": [ "ec2:DeleteDefaultVpc", // ... (중략) ... "iam:CreateUser", "iam:DeleteUser", "iam:CreateAccessKey", "iam:DeleteAccessKey", "iam:CreatePolicy", "iam:DeletePolicy", "iam:AttachUserPolicy", "iam:DetachUserPolicy" ], "Resource": "*" } ] } DenyTouchingOtherProjects 정책은 Project 태그가 anasudal 이 아닌 리소스에 대해 특정 파괴적인 작업을 명시적으로 거부한다. 또한, DenyAccountWideDamage 정책은 IAM 사용자/정책 조작과 같은 권한 상승 가능성이 있는 작업을 금지하여 보안을 강화했다. 2. (BE) Windows PowerShell을 위한 자동화된 키 입력 ( infra/scripts/login.ps1 ) AWS CLI 키를 수동으로 붙여넣는 대신, 파일이나 메모장에서 자동으로 키를 찾아 입력하는 기능을 추가하여 사용자 경험을 개선했다. # ... (중략) ... # -- 키 읽기 도우미 ----------------------------------------------------------- # 형식을 가리지 않는다. csv / 메모장 메모 / 아무 텍스트에서나 정규식으로 찾아낸다. # 액세스 키 ID : AKIA/ASIA + 영숫자 16자 # 시크릿 : base64 문자 40자 function Get-AwsKeyFromText ($text) { if (-not $text) { return $null } $id = $null; $sec = $null # (1) key = value 표기 (메모장 템플릿, 환경변수, ~/.aws/credentials 형식) $m = [regex]::Match($text, '(?im)^\s*(?:aws[_ ]?)?access[_ ]?key[_ ]?id\s*[=:]\s*["'']?([A-Z0-9]{16,128})') if ($m.Success) { $id = $m.Groups[1].Value } $m = [regex]::Match($text, '(?im)^\s*(?:aws[_ ]?)?secret[_ ]?access[_ ]?key\s*[=:]\s*["'']?([A-Za-z0-9+/=]{30,128})') if ($m.Success) { $sec = $m.Groups[1].Value } # (2) 콘솔에서 받은 .csv — 헤더 이름으로 열을 찾는다. # IAM 사용자 csv 에는 비밀번호 열이 섞여 있어서, 위치로 찍지 않고 이름으로 찾아야 한다. if (-not ($id -and $sec)) { try { foreach ($r in @($text | ConvertFrom-Csv)) { foreach ($p in $r.PSObject.Properties) { $n = ($p.Name -replace '[^A-Za-z]', '').ToLower() if ($n -match 'accesskeyid') { $id = $p.Value } if ($n -match 'secretaccesskey') { $sec = $p.Value } } } } catch { } # ConvertFrom-Csv 가 실패해도 무시 } # (3) 생김새 기반 폴백 — 헤더 없이 키만 있는 경우 if (-not $id) { $m = [regex]::Match($text, '(?m)\b(AKIA|ASIA)[A-Z0-9]{16}\b'); if ($m.Success) { $id = $m.Value } } if (-not $sec) { $m = [regex]::Match($text, '(?m)\b[A-Za-z0-9+/=]{40}\b'); if ($m.Success) { $sec = $m.Value } } if ($id -and $sec) { [PSCustomObject]@{ AccessKeyId = $id; SecretAccessKey = $sec } } else { $null } } # ... (중략) ... Get-AwsKeyFromText 함수는 CSV 파일, 메모장 내용, 또는 일반 텍스트에서 AWS 액세스 키 ID와 시크릿 액세스 키를 자동으로 추출한다. 이를 통해 사용자는 키를 직접 복사하여 붙여넣는 번거로움 없이 쉽게 초기 설정을 완료할 수 있게 되었다. 3. (BE) Gemini 키 풀 분리 및 폴백 설정 ( backend/app/core/config.py ) Gemini API 키를 용도별로 분리하고, 키 풀을 활용하여 429 에러 발생 시 단계적으로 대응하도록 변경했다. # backend/app/core/config.py # ... (중략) ... class Settings(BaseSettings): model_config = SettingsConfigDict(env_file=".env", env_file_encoding="utf-8", extra="ignore") database_url: str # ── Gemini 키 # 답변·임베딩(사용자가 기다리는 경로)은 여러 개를 돌려 쓴다. 콤마로 구분. gemini_api_keys: str = "" # 질문 요약(백그라운드로 DB 에 쌓는 것) 전용. 답변 쿼터를 갉아먹지 않게 분리. gemini_summary_key: str = "" # 하위호환 — 키가 하나뿐이던 시절의 이름. 위 두 개가 비면 이걸 쓴다. gemini_api_key: str = "" # ... (중략) ... @property def answer_keys(self) -> list[str]: """답변·임베딩용 키 목록""" return _split(self.gemini_api_keys) or _split(self.gemini_api_key) @property def summary_keys(self) -> list[str]: """요약 전용 키. 따로 안 주면 답변 키를 같이 쓴다(개발 환경).""" return _split(self.gemini_summary_key) or self.answer_keys # ... (중략) ... gemini_api_keys 는 사용자에게 즉시 응답해야 하는 답변 및 임베딩에 사용되며 여러 키를 로테이션한다. gemini_summary_key 는 백그라운드에서 실행되는 질문 요약 전용으로, 사용자 대기 경로의 쿼터에 영향을 주지 않도록 분리했다. 결과: 비용 절감과 안정적인 배포 환경 이러한 변경으로 인프라 월 비용은 94달러에서 24달러로 대폭 절감되었다. 배포 과정은 단일 스크립트 실행으로 간소화되었고, Windows PowerShell 환경에서도 원활하게 작동하게 되었다. 프로젝트 전용 IAM 정책으로 기존 프로젝트와의 간섭 가능성을 완전히 차단하고, CloudFront를 통해 HTTPS를 지원하게 되어 서비스의 안정성과 보안이 강화되었다. Gemini API 키 관리 및 폴백 강화 문제: 단일 Gemini 키의 한계와 429 에러 대응 부재 이전에는 하나의 Gemini API 키로 모든 LLM 작업을 처리했다. 이는 사용자가 기다리는 답변 생성, 임베딩, 그리고 백그라운드에서 이루어지는 질문 요약까지 모두 같은 쿼터를 소모하게 만들어, 429(Rate Limit Exceeded) 에러 발생 시 서비스 전체에 영향을 줄 수 있었다. 429 에러에 대한 적절한 폴백(fallback) 전략이 없어 사용자 경험을 해칠 우려도 있었다. 판단: 키 풀 분리와 단계적 폴백 구현 사용자 대기 경로의 안정성을 최우선으로 고려하여, Gemini API 키를 두 묶음으로 분리하고 429 에러 발생 시 단계적으로 대응하는 전략을 수립했다. 키 풀 분리: GEMINI_API_KEYS : 사용자에게 직접 응답하는 답변 생성 및 임베딩에 사용되는 키 묶음. 여러 키를 등록하여 로테이션하며 사용한다. GEMINI_SUMMARY_KEY : 백그라운드에서 질문을 요약하여 DB에 저장하는 용도 전용 키. 답변 쿼터와 분리하여 운영 안정성을 높였다. 429 단계적 폴백: 1단계 (키 로테이션): 429 에러 발생 시 해당 키를 잠시 쉬게 하고 즉시 다음 키로 재시도한다. 쉬는 상태는 Redis에 공유하여 여러 ECS 태스크가 같은 죽은 키를 반복해서 호출하는 것을 방지한다. 2단계 (대체 답변): 모든 키가 소진되었지만 근거 데이터는 확보된 경우, LLM 없이 근거와 출처를 그대로 보여주는 대체 답변을 제공한다. 치료 영역은 지식 청크의 K-DST 영역에서 추출하여 기관 추천까지 이어지도록 했다. 3단계 (오류 응답): 검색(임베딩)조차 불가능한 경우, 503 LLM_RATE_LIMITED 에러와 함께 재시도 가능 시간을 안내한다. 4단계 (요약 키 소진): 질문 요약 키가 소진된 경우 조용히 넘어가 question_summary 만 비워둔다. (사용자 대기 경로에 영향 없음) 키 풀 상태 모니터링: GET /health 엔드포인트에 키 풀 상태를 노출하여 운영자가 쉽게 확인할 수 있도록 했다 (키는 해시 앞 8자만 표시). 결과: 안정적인 LLM 서비스 운영 Gemini API 키 풀 분리와 단계적 폴백 구현을 통해 429 에러 발생 시 사용자 경험에 미치는 영향을 최소화하고, LLM 서비스의 안정성을 크게 높였다. 백그라운드 작업이 사용자 대기 경로의 쿼터를 소모하지 않게 되어 전체적인 서비스 지연 위험도 줄었다. 데이터 보강으로 기관 정보 정확도 향상 문제: 낮은 좌표 매칭률과 운영시간·홈페이지 정보 부재 공공데이터 기반의 전국 기관 2,866곳 중 좌표 매칭률이 65.6%에 불과했고, 카카오맵과 공공데이터 간 기관명 불일치로 인해 이름 매칭이 실패하는 경우가 많았다. 특히 운영시간과 기관 자체 홈페이지 정보는 거의 전무한 상태였다. 판단: 카카오 API를 활용한 데이터 보강 기관 정보의 정확도와 풍부함을 높이기 위해 카카오 API를 적극적으로 활용하여 데이터를 보강했다. 카카오 주소검색을 통한 좌표 보강: 기존의 기관명 키워드 검색 방식에서 벗어나, 주소 검색을 우선적으로 사용했다. 도로명 주소 정리 및 시군구 보정 로직을 개선하여 이름이 다르더라도 주소가 맞으면 매칭되도록 했다. 이로써 좌표 매칭률을 65.6%에서 95.0%로 크게 끌어올렸다. 카카오 플레이스 API를 통한 운영시간·홈페이지 수집: 카카오 공식 REST API에는 없는 운영시간과 홈페이지 정보를 카카오맵 웹이 내부적으로 사용하는 비공개 place-api.map.kakao.com 엔드포인트를 통해 수집했다. 비공개 API 사용에 따른 위험을 인지하고, 기본 1.5건/초의 속도 제한과 8건 연속 실패 시 자동 중단 기능을 구현하여 안정성을 확보했다. 수집된 운영시간은 '월 금 10:00 19:30, 토 09:30~18:30'과 같이 보기 좋게 정리하고, 휴무일도 표시하도록 파싱 로직을 개선했다. 이름 매칭 완화: '파랑새감각통합언어발달'과 '파랑새감각통합언어발달센터'처럼 접미사만 다른 경우를 놓치지 않도록 정규화 후 포함 관계를 인정하되, 오탐 방지를 위해 6자 이상일 때만 적용했다. 결과: 풍부하고 정확해진 기관 정보 데이터 보강 작업을 통해 기관 좌표 매칭률은 95%에 달했고, 전화번호 매칭률도 90.4%로 개선되었다. 운영시간은 0%에서 30.7%로, 카카오맵 링크는 71.5%로 대폭 증가하여 사용자에게 더욱 풍부하고 정확한 정보를 제공할 수 있게 되었다. 마무리 이번 한 주간 "안아수달" 프로젝트 백엔드는 인프라 비용 절감, 배포 과정 자동화, Gemini API 안정성 강화, 그리고 기관 정보 데이터 보강이라는 네 가지 주요 목표를 성공적으로 달성했다. 이를 통해 서비스의 운영 효율성과 안정성을 높이고, 사용자에게 더 나은 경험을 제공할 수 있는 견고한 기반을 마련했다. 앞으로도 지속적인 개선을 통해 더 나은 서비스를 만들어 나갈 것이다.
Балл: 56.97Уверенность: 54%
Балл: 56.96Уверенность: 54%
Балл: 54.4Уверенность: 49%
Балл: 54.4Уверенность: 49%
Балл: 54.4Уверенность: 49%