我 Общие новости
人人都是产品经理
深度学习检测项目做砸,往往不是算法问题,而是数据管理失控。本文从样本库建设、训练集版本冻结、7:2:1 切分门道到标注降门槛,拆解如何把数据资产管成流水线,让质检员也能上手标注,避免项目上线六个月后死于样本库烂掉。 前面《检测数据反哺制造端》那篇下面,有读者留言:训练集 7:2:1,为什么是这三个数,各干什么用。这条留言我盯着看了半天——问对地方了。深度学习检测项目做砸,砸在算法上的少,砸在数据怎么管上的多。这一篇就把上一篇埋的线头抽出来展开:样本库怎么建、训练集版本怎么冻结、7:2:1 怎么切、客户自己标注的门槛怎么降到质检员能上手。 先说一个我亲眼见过的样本库。 去年去一家客户做年度回访。项目跑了八个月,模型效果开始往下掉,客户问还能不能救。我请他们把样本库给我看看。设备科的小伙子打开共享盘:一个叫“检测图片”的文件夹,里面套着十几个子文件夹——划痕、划痕-新、划痕-最终版、划痕-最终版2、新建文件夹(3)、待整理。他挠着头说,每次换型就新建一个,后来就乱了。 两万七千张图。没有命名规范,没有时间戳以外的任何信息;哪些图训练用过、哪版模型吃了哪些图,没人说得清。最要命的是“划痕-最终版2”里有三分之一跟“划痕”是同一批图,复制出来改了个名。 这个库撑不起任何一次像样的迭代。我没跟客户客气:你们不是缺数据,是把数据资产管成了文件夹。深度学习项目上线六个月后死掉的,一半死于上一篇讲的模型漂移,另一半死于样本库烂掉。漂移有人写文章,烂库没什么人写。这篇写它。 一、样本库不是文件夹,是一条入库流水线 产品上的第一刀,是把“存图”改成“入库”。 区别不在叫法,在动作。存图,是把文件扔进文件夹,从哪来、谁放的、什么条件下拍的,全靠人缘;入库,是每张图过一遍流水线,带着元数据落库。而且入库口子只有一个——检测设备、复判工位、手动上传,殊途同归走同一道门。口子一多,“划痕-最终版2”就会自己长出来。 流水线第一段:自动带标签。时间戳、产线工位、相机序列号、光源批次、产品型号、当时的检测配方版本、设备判定结果和置信度、人工复判结论。这些字段不需要任何人动手,图进来的那一刻系统自己知道。反哺那篇讲过换灯管的教训——光源批次一换,图像亮度分布跟着变,模型学到的不是“什么叫划痕”,是“什么亮度算异常”。防它不靠人的记性,靠库的记性:环境条件写成元数据,日后组训练集才有得挑。 第二段:去重。同一根型材连拍三张、同一个工件正反面、还有“复制一份改个名”,都算近重复。近重复不清,某一茬数据虚胖,训练权重被无声放大,你还以为样本量够了。工程上感知哈希先粗筛,机器拿不准的才排队等人扫一眼。 第三段:分级存储。算笔账:一张 500 万像素检测原图两三个 MB,一天四百张复判图,一个月就是三四十 GB,全量原图保一年,TB 级就去了。产品决策点在这:保留策略做成可配置——确认缺陷图全量长期保,过杀复判图按类型抽样保,OK 图默认七天滚动清。别替客户拍板,也别不给出路。 元数据字段本身分两档。时间戳、工位、判定结果是硬字段,系统内置;模穴号、料批号、镀膜批次这类行业字段做成可配置——注塑件要模穴,3C 玻璃要批次,你猜不完,让字段自己长在客户的库里。 还有个容易被忽略的体验问题:样本库的第一用户体验是查,不是存。按“七月、三号相机、脏污类、置信度 80 到 90”三个条件,三秒出结果,工程师才愿意用它;查一次等半分钟,人家转头就去翻文件夹,流水线再对也白搭。 二、版本冻结:训练集要对得上账 第二个产品动作:训练集上版本。 很多团队的做法是训练前“从库里挑一批图”,挑完即散。下次迭代再挑,两次挑的不一样,效果就没法比——模型这回好了,是数据变好了还是参数调对了?说不清。说不清,迭代就退化成抽签。 我的做法:训练集定义成一个带版本号的清单。v2.1 = 筛选条件(哪些时段、哪些类型、各类多少张)加样本哈希列表。清单生成那天就冻结,只读。图可以搬家、可以换存储,清单不动。这一版清单喂出的模型、它的离线评估结果,都挂在 v2.1 名下。模型版本、数据版本、评估结果,三张表对得上账。 这套东西平时像仪式感,两个时刻救命。 一个是质量体系审核。审核老师问:这台设备上跑的判定模型,哪个版本、用什么数据训练的、验收记录在哪。有版本链,五分钟调齐;没有,现场翻共享盘,翻到哪算哪。 一个是客诉追溯。客户端流出去一批可疑品,要回头看:出事那周模型是什么版本、训练数据覆盖哪些批次。要是那周恰好迭代过,你还答得上来“新版比旧版多了哪三千张图”吗?答不上来,锅就是你的。 说穿了,这就是软件工程管代码的那套版本控制,挪过来管数据。工程师觉得天经地义,客户往往耳目一新——这个落差,就是产品机会。 三、7:2:1 的门道:按什么切,比切多少重要 回那条留言。 7:2:1,训练七成、验证两成、测试一成。三个集合三个用途:训练集是课本,模型从它学;验证集是作业,调参的时候反复看;测试集是期末考,进了考场才许翻出来。混着用,等于考完试再复习。 为什么偏偏是 7:2:1?实话实说,经验值,不是定律。几千张往上,7:2:1 挺稳;小项目几百张,我宁可 8:1:1,甚至交叉验证——测试集太薄,一次考试说明不了什么。类别不均衡时(罕见缺陷几十张、脏污几千张是常态),要按类别分层切,保证每个类在三个集合里都有人,别让稀有类在测试集里一个不剩。 但真正翻车的多发点不是比例,是切分单位。 新手做法:全部图扔进池子,随机抽一成当测试集。看着公平,其实在作弊。检测图彼此不独立——同一根型材连拍三张长得几乎一样,同批料、同时段的图高度相似。随机切,近亲被拆进两个集合,模型考试碰上“见过的人换件衣服”,测试集 98%,上产线 90% 都悬。这叫数据泄漏,检测行业的重灾区。 防它就一条:切分单位往上提。按工件切、按批次切、按时段切,同一工件的图要么全在训练集、要么全在测试集,不许跨。再稳一手,时间后移:训练用一到六月的数据,测试用七月的。产线真实的考法,就是“拿过去的模型,考未来的题”。 反哺那篇说过“测试集必须是模型没见过的新时段数据”,展开就是这两句:分组防近亲,后移防作弊。 再补一条纪律:测试集别反复用。每轮迭代都拿同一份测试集考,调参的人其实是在对着答案改卷子,改到第十版,测试集也成了练习册。评估结果挂版本,等于给自己留体检记录——哪怕你明知在污染,至少污染得有数。 四、标注降门槛:让质检员上手,别等工程师 库和账讲完,讲人。上一篇算过这笔账:框缺陷位置,每类 500 张起步。谁来标? 最合适的人不是算法工程师,是客户的质检员。他们认得缺陷,判定口径跟质量体系一致,人就在产线上。卡脖子的是工具:传统标注界面是给算法工程师设计的,类别名叫“线性纹理缺陷”,界面上二十个按钮,画个框还要调锚点——质检员打开看一眼就关了。 我们做标注模块,产品原则一句话:把“标注”翻译成“复判”。质检员天天干的活就是复判:看图、判 OK/NG、选缺陷类型。界面顺着这个动作长,四个动作: 免标注优先。最好的标注是没人标的标注。设备判 NG、人工复判放行或确认,这个动作本身就在产标签——反哺那篇的训练集回收,源头在这。产品要做的只是让复判记录自动落库,别让这条免费的河白流。 预标注。模型先标一遍,人只改错。从“画框”变成“挪框、删框”,效率差三到五倍。更要紧的是角色变了:质检员不再是生产标签的,是审核标签的。审核的心理负担小,才坚持得下去。 低置信度优先。待标队列别按时间排,按模型的没把握程度排,最虚的图排最前面,标三百张顶一千张——上篇提过,出处在这。对产品的真实要求,是标注界面和模型服务之间有一条置信度通道。这不是算法功能,是数据流设计。 两步走。新手先干 OK/NG 大判,一张一两秒;熟了再放开细类和边界框。界面分模式:复判模式就三个大按钮,标注模式才展开细类。角色也分层:质检员大判,老师傅细分,主管仲裁,算法工程师只管训练、不碰标注——权限跟着角色走。 兜底是标注质量。主管随机抽 5% 复核;两个人背对背标同一批,对不上的进仲裁队列,仲裁结论回写进规范;每类缺陷的标注规范里嵌样例图,边界争议看图说话,不靠悟。效率要能量出来:张每人时、预标注修改率、双人一致率,三个数上看板,标注团队的管理从“感觉”落到数字。 五、这一套东西,是检测软件的第二形态 回头看:入库流水线、版本冻结、切分纪律、标注工位——没有一个像素长在“检测”上。检测软件的界面是相机、光源、算子、判定;这套的界面是样本、版本、队列、看板。但它们决定同一件事:这套系统三年后还准不准。 上一篇第三笔账问“客户接不接得住”,接住的办法就是这一篇。有这套数据底座,托管服务是远程看几个看板、按期出迭代;没有,托管服务是每月派人去客户机房翻文件夹——成本差几倍,报价单上看不出差别。不少同行把深度学习做成赔本买卖,根子在这。 下一篇讲这条链的最后一环:模型训好了,怎么上产线。新版本直接推过去,万一比旧的差,停线算谁的?灰度、AB、回滚,检测模型的发布流程怎么做,下篇展开。你如果正在建样本库,卡在哪一步,评论区说说,我给你参谋参谋。 (系列前篇:《我所了解的机器视觉检测产品应用(5):检测数据反哺制造端,从判级工具到数据资产》《(6):深度学习还是传统算法?先别比准确率,算三笔账》) 专栏作家 互联网产品经理Mik,公众号:逆袭产品汪,人人都是产品经理专栏作家。专注于ToB领域产品,包括机器视觉、工业大数据、MES、ERP和物联网等方面。 本文原创发布于人人都是产品经理,未经许可,禁止转载 题图来自 Unsplash,基于 CC0 协议 该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。
Балл: 57.38 Уверенность: 54%
Подробнее 设 Общие новости
掘金
设计模式是语言缺陷的补丁。用 C++11→20 的演进史,逐个验证工厂、单例、策略如何被语言特性替代,以及为什么过度设计是必付的税。
Балл: 57.38 Уверенность: 54%
Подробнее C Общие новости
人人都是产品经理
ChatGPT 与 Codex 合并之后,桌面端迎来一次大更新:产品被拆成聊天与工作两种模式,普通聊天也能调用搜索、文件分析和沙箱代码执行,云端执行让任务不再依赖电脑持续开机,图像模式与插件生态同步补齐。 继7月份ChatGPT、Codex合并之后,ChatGPT 桌面端迎来最大一次更新 产品布局大调整,目前已经完全不需要再打开网页端 ChatGPT 了 我数次写过 ChatGPT 用法,本文有必要更新一下了 1、善用聊天模式 OpenAI 把产品边界说得非常清楚 ChatGPT 用途是创建、学习和探索 Codex 用途是构建、调试和发布 ChatGPT 分为聊天和工作两种模式 聊天模式:今天聊点什么?核心是对话、沟通 为何要擅用聊天模式呢,它可以使用 GPT-6 Pro ,而且不占用你的周限额! 你可以与 GPT-6 做需求沟通、产品设计,真正开发阶段再用工作模式或 Codex 模式 聊天模式有云端执行环境,有些任务也能在Chat 模式完成,它和工作模式的界线没有那么严格,比如我之前让其帮我做的视觉设计 不是“聊天只能说,工作才能做” :普通聊天也有搜索、文件分析和安全环境中的代码执行能力 chat 模式也可以创建项目,同类型的问题或长期任务都可以放进来 2、工作在云端 工作模式的Slogan是“我们要做什么?”核心是干具体的活儿,面向较长、多步骤任务和完整交付成果的智能体 你的需求 更建议选择 怎么用 解释一个 AI 概念、讨论技术方案 聊天 反复追问,逐步把问题想清楚 改公众号标题、润色段落、推敲文章观点 聊天 你主导创作,它陪你打磨 调研几个模型,收集资料、核对参数,最后交付报告和对比表 工作 给出范围、来源要求和交付格式,让它完成整个流程 检查多个 Excel,修正公式、合并数据,再交回修改后的文件 工作 直接围绕文件执行,而不只是告诉你怎么改 根据资料制作完整的 Word、PPT 或网站 工作 明确成品要求,并审核最终结果 在哪里工作呢? 它支持在本机运行,也可以在ChatGPT提供的云端沙箱执行 云端工作运行在 OpenAI 管理的基础设施上,使用 虚拟机支撑的沙箱(VM-backed sandboxes) ,并采用 Codex 的任务执行框架。它和 Codex 共享部分执行、隔离机制,但工具和权限并不完全相同 OpenAI 提供的这个云端之行环境配置还是不错的,之前我是 Plus 套餐时查询过,给我分配的沙箱实例是4 核 CPU、4 GB 内存的 Linux 容器 升级Pro之后,配置更好了点,9核 + 9 GB内存,云端模式比较适合长任务,定时任务,以及所有不想本地执行的任务 我有很多次出差在外,手机想要遥控家里Mac,发现设备掉线(网络不稳)的情况,这时就可以让其拉取GitHub仓库后在云端调试 云端还有一个优势:任务不依赖你的电脑持续开机,任务在你离开对话、关闭电脑后仍可继续 场景 建议 关键原因 查公开资料、研究 GitHub 项目、整理技术报告 工作·云端 不依赖你本机的环境 上传文章阅读数据,算月度均值、中位数并生成图表 工作·云端 输入材料上传后即可处理 上传 Word、Excel、PDF,要求整理、修改、交付成品 工作·云端 不需要直接操作本地原文件 通过已授权连接读取邮箱、网盘等资料 工作·云端 前提是对应连接支持所需操作 直接整理你的 Obsidian/iCloud 本地目录 工作·本地 需要直接读写该目录 操作 Mac 上的应用,使用现成的本地工作流 工作·本地 依赖本机应用和权限 在已有 Python/Swift 工程里开发、调试 Codex,按工程环境选择执行位置 需要围绕代码和开发工具工作 对你自己的 GPU、模型部署环境做性能实测 自己的设备或专用服务器 测试结果必须对应你要评估的硬件环境 工作可能跨任务复用环境,也可能更换环境并保留符合条件的状态;而 沙箱执行状态、聊天记录、Library 文件、项目文件有不同的生命周期 。聊天还在,不代表原来的进程还在运行 我建议把它当作 任务工作区 ,不要当作唯一存储位置:源代码保存在正式仓库,重要成果下载或明确保存到 Library/项目。需要长期在线的网站、数据库或模型服务,另用正式运行环境 3、资料库:被忽视的 OpenAI 云盘 ChatGPT 这个资料库,很多人没有用起来,Pro 会员提供的是 100GB 容量大云盘 它还能通过插件把其他云盘挂在过来,比如 Google Drive 我用的也不是特别好,只把一些历史文章md还有阅读数据放进来了,时常让其帮做选题、标题优化、月度数据分析 4、图像模式:脱离网页 我之前的感受,网页端图像生成要比 Codex 生成的效果好 现在这里也和网页端一模一样了,绘图模式、模板等都可以用 5、插件:生态越来越丰富 Codex 的插件我介绍过很多次了,虽然太多不适合中国宝宝体质的,很多收费的,不妨碍它的强大:# Codex 的插件太让人上瘾了 我经常会翻一翻,看有没有有趣的插件可以玩 ✦6、ChatGPT 地图:更懂规划的旅游搭子,但不懂国内用户 6、ChatGPT 地图:更懂规划的旅游搭子,但不懂国内用户 不知道这个是什么时候上线的?官方文档没有找到太好的用法,可能核心是餐厅预订吧 我在对话框询问地图相关问题,并没有调用到它的能力,而且大量失败,感觉国内用户不太友好 ChatGPT 显然是奔着超级 App 去了,未来必然是超级 App 吞噬一切的趋势 从日常聊天、云端沙箱、代码工程、设计绘图,再到地图和生活服务,它正在把原本分散在不同窗口里的活儿一口气全接管过来 不过国内用户自然不会把它当成全能生活入口,生态壁垒摆在那里,许多本地服务接不进来。像记事本、待办 Todo、天气、记账、出行这些日常刚需,国内的豆包、Workbuddy、千问大概率会更快拿下普通用户的桌面 但单看生产力和个人工作流,ChatGPT 桌面端这波整合确实狠,它直接重构了我的日常用法: 简单沟通、推敲灵感,停在 Chat 模式最舒服,使用 GPT-6 Pro 还完全不占周额度 长周期的资料调研、数据分析、自动化任务,扔给云端沙箱,关掉电脑也能持续跑 真正的复杂工程开发,依然交给深度绑定的 Codex 模式去搞 以前在浏览器里开几十个标签页、随时担心断连或丢会话的日子基本彻底过去了。现在的桌面端更像一个随时待命的个人工作台,开机挂在后台随时调遣 作者:Ai学习的老章 公众号:Ai学习的老章 本文由 @Ai学习的老章 原创发布于人人都是产品经理。未经作者许可,禁止转载 题图来自 Unsplash,基于CC0协议
宇 Общие новости
Readhub
宇树科技全资持股的杭州宇树机器人有限公司近日发生工商变更,注册资本由 10 万人民币增至 2510 万人民币,增幅 25000%。该公司成立于 2019 年 4 月,法定代表人为王兴兴,经营范围包括软件开发、软件销售、智能机器人的研发等。
Балл: 57.37 Уверенность: 54%
Подробнее 超 Общие новости
掘金
读图映超分Worker:WebGPU块160、WASM块96,重叠占24%对36%,每有效像素12.9对22.9微秒,整图推算差1.8倍;讲小块换来了什么。
Балл: 57.37 Уверенность: 54%
Подробнее M Общие новости
Readhub
消费科技测评博主罗布启用了 Meta 新推出的 Muse AI 打理脸书集市的商品挂帖,该 AI 误将他填写的自提地点和开启的自动回复两项设置当成许可,在未获授权的情况下擅自以罗布的身份与意向买家乌斯曼沟通,洽谈交易、接受低价报价,还泄露罗布的家庭住址,邀约乌斯曼上门,甚至编造罗布在家、临时有事耽搁等虚假信息,全程未向罗布发出任何提醒,导致乌斯曼白等二十分钟。乌斯曼始终以为自己在和罗布本人对话,罗布直到 24 小时后才得知整件事。事后罗布测试发现 Muse 仍多次向外泄露他家地址,且该 AI 不会像 Meta 旗下其他 AI 一样明确标记对话由机器人发出,几乎完全模仿用户本人说话。Meta 相关负责人称经调查 Muse 通常会遵照用户直接指令行事并正常请求许可,希望协助查明本次事件原委,但联系罗布后便再无下文,Muse 最终也承认是自身错误操作导致了事件发生。
Балл: 57.37 Уверенность: 54%
Подробнее 月 Общие новости
Readhub
多名开发者发现月之暗面 API 平台后台模型注册表中出现可调用的 kimi-k3-1 标识,随后 Kimi 官方开放平台出现支持 1M tokens 上下文窗口的 K3.1 相关模型预告。该模型预计最高支持 100 万 Token 上下文窗口,提供三档推理强度选项,可能引入智能体模式、多智能体协作及搜索、批处理等任务模式,多档推理强度或对应不同算力配置与计费模型,目前平台显示其 API 价格与现有 K3 相同,不排除为占位符的可能,Kimi K3.1 预计下月登场。
Балл: 57.37 Уверенность: 54%
Подробнее 吉 Общие новости
Readhub
蔚来与吉利控股达成充换电领域全面战略合作,吉利控股旗下子公司以所持易易互联 100% 股权和 6.4 亿元现金认购蔚来能源新增股权,交易完成后吉利将持有蔚来能源 30% 股权,蔚来中国持股 63.6% 保持控股,易易互联的营运车辆换电业务并入蔚来能源,蔚来能源本轮投后估值约 160 亿元。双方还设置了股权调整相关约束,吉利同时享有追加投资选择权。此外蔚来将认购吉利旗下浩瀚能源新增股权,交易完成后持股 10%。交易完成后蔚来能源将运营分别面向个人用户和营运车辆的两张独立换电网络,双方将在制造、供应链、运营等环节整合资源。本次交易为蔚来能源带来成熟的 B 端营运车辆换电业务,吉利也得以降低独立扩建换电网络的压力并分享换电业务收益。当前国内补能行业正从规模扩张转向提升资产效率,换电商业模式高度依赖规模,此前蔚来换电体系对外开放后跨品牌落地进展缓慢,双方后续将以 Robotaxi 为先行落地场景推进合作,还计划共建个人用户换电技术和标准,相关合作仍待进一步落实。
Балл: 57.37 Уверенность: 54%
Подробнее 星 Общие новости
Readhub
星舰第十四次试飞首次进入轨道,成功将 26 颗 V3 版星链卫星送入轨道,完成离轨点火后在夏威夷以北海域软着陆。本次试飞两级均出现发动机提前熄火的情况,未完成原定绕地球 6 圈的计划,仅飞行约 3 小时便提前返回。至此星舰结束此前 13 次的亚轨道飞行阶段,跨过入轨门槛。此次试飞验证了入轨、载荷释放、轨道返回等关键能力,还首次实现 V3 版超重助推器完整落水、复用翻新隔热瓦,是星舰研发历程的重要节点。目前星舰仍存在发动机可靠性不足、长时在轨能力未经验证等问题,后续需推进相关技术测试与发射基地建设,支撑星链组网、阿尔忒弥斯登月、火星探测等后续计划。
Балл: 57.36 Уверенность: 54%
Подробнее 中 Общие новости
Readhub
中信建投研报指出,Meta Muse 与云栖大会共同强化 AI 应用落地拉动算力需求的逻辑。Meta 推出个人 AI 助手 Muse,推动消费级智能体商业化。云栖大会上,阿里披露大模型后续规划、发布新芯片并提出相关目标,推动企业智能体落地。AI 由对话向任务执行升级,有望持续增加推理、工具调用及云资源需求,关注高速光模块、交换机、服务器、液冷与电源等环节。
Балл: 57.36 Уверенность: 54%
Подробнее A Общие новости
掘金
ReAct 循环会推理,但推理不能凭空产生事实。模型训练截止后的产品文档、企业内部的接口约定、用户上传的 PDF,都不在参数记忆里。02 篇结尾说过一句话:工具是 Agent 的手,检索是 Agent
Балл: 57.36 Уверенность: 54%
Подробнее 今 Общие новости
Readhub
中国物流 1 至 8 月运行稳中有进,物流市场规模稳步扩张,国际物流通道扩容提质。全国社会物流总额 243.6 万亿元,同比增长 4.9%,社会物流总额实现稳定增长与结构优化同步推进,产业链供应链韧性进一步凸显。其中工业品物流基本盘稳定,升级类工业制造物流需求加速,8 月高技术制造业、数字产品制造业增加值增速亮眼,工业机器人产量大幅增长,共同带动新增物流需求。
Балл: 57.36 Уверенность: 54%
Подробнее