内容摘要
这场分享的核心结论是:大模型竞争的主瓶颈已经从架构和算力转向数据、专家监督与可执行环境。谁能把真实专家判断、生产日志和可验证任务持续转成高质量数据产品,谁就更可能把 AI 推进到真实工作流里。
关键观点
数据已从“商品”变成 AI 的核心瓶颈
开场直接修正了一个旧判断:数据业务的终局价值不是零,反而已经成为 AI 价值创造的重要来源。演讲者认为,当前限制模型继续深入经济活动的,不是架构本身,也不是 GPU 或功耗,而是高质量、可更新、与任务匹配的数据。尤其在医生、律师、会计、交易员等高专业度场景里,缺的不是通用语料,而是专家轨迹、偏好数据和可验证环境。这个判断把“数据公司”从配套角色抬升成了能力基础设施。
为什么重要: 如果你在做 AI 产品,资源优先级应从“再换一个模型”转向“建立持续获取、更新和验证数据的机制”。这决定了产品能否进入高价值真实场景。
支撑证据
It is the bottleneck right now. It is not the architecture. It is not GPUs. It is not watts.
生产问题先看数据,不先调模型结构
演讲者用“hot dog / not hot dog”举例,强调当模型已经做到 85% F1 后,下一步不是读论文、换激活函数或加层数,而是回到错误样本本身。正确做法是系统查看 false positives 和 false negatives,再按 Pareto 桶归类,找出最大的失效模式。很多问题并不是模型表达能力不够,而是输入本身被雾气、遮挡、人为干扰破坏,继续调架构并不会解决。这个方法论把模型优化变成错误分布管理。