现代汽车集团数据飞轮全面运转:700万辆年销量的数据喂给自动驾驶AI

2026-09-14·8分钟阅读

2026年9月13日,现代汽车集团在官网发布新闻稿,宣布其数据飞轮(Data Flywheel)已全面投入运行,标志着自动驾驶技术战略进入新阶段。所谓数据飞轮,是一套把数据采集、AI训练、验证和部署串成闭环的系统:车辆采集真实道路数据,数据用于训练和验证模型,改进后的模型再部署回车辆,从而产生新一批数据。当天,集团在位于韩国京畿道的 42dot 总部举办自动驾驶媒体日(HMG Autonomous Driving Media Day),公布了自动驾驶开发战略、技术路线图、关键成果与落地计划,并首次公开了一段搭载自研 Atria AI 的 SDV 测试车在复杂城市交通中无人工干预行驶的画面,能力等级为 L2++。

先看数据规模,这是整套逻辑的起点。现代与起亚每年在全球约190个国家和地区卖出超过700万辆车,这个产量本身就是数据采集的基础设施。目前集团运营约40辆专用数据采集车,全天候采集行驶数据,数据集覆盖的不只是日常通勤场景,还包括大量长尾边角案例:道路施工区与基础设施变化、恶劣天气、突发变道与紧急机动、小街窄路上的路边停车、复杂城市交通流。值得留意的是,这套叙事把竞争维度讲得比过去更清楚:自动驾驶的竞争不再是比较某个具体功能,而是比谁掌握的数据多、谁学得快、谁把结果更快落到产品和服务上。42dot CEO 兼集团先进车辆平台(AVP)部门总裁 Minwoo Park 的原话是,竞争力取决于你能不能建立起持续快速学习的系统,目标是让客户信任,同时在保证安全与质量的前提下快速学习和改进。

第二个看点是学习技术,因为光有数据量并不构成优势。新闻稿里有一句话说得挺实在:自动驾驶 AI 的性能不是由数据量单独决定的,而取决于开发者能否有效识别那些让模型为难的场景,并把学习集中到这些场景上。为此,集团从今年早些时候开始往数据飞轮里加了几样东西。困难样本挖掘(Hard Example Mining)自动识别模型难以识别或解读的挑战性场景,优先纳入训练。持续训练流水线把新采集的真实道路与验证数据不断并进模型训练,车辆评估的发现又回流到数据采集和模型开发,缩短开发周期。虚拟验证则用三维重建加图形技术解决现实里做不了的问题——集团把真实道路数据重建为三维环境,使用 3D Gaussian Splatting 这类先进图形技术复现现实中难以安全复现的场景,让工程师反复在多样边角案例上评估模型,同时验证新训练的模型没有让既有性能退化。此外还有跨时区的追日式开发(Follow-the-Sun),把韩国和美国的开发中心连起来,利用时差接力做数据采集、问题分析与模型改进,实现近乎 24 小时连续开发;以及逐步接入的 Special Event Recorder(SER),自动记录自动驾驶过程中的重要事件及相关数据用于训练。

第三个也是最有信息量的部分,是双轨策略的具体时间表。集团今年3月公布了与英伟达的合作策略,把路线拆成两条。第一条轨是把英伟达已验证的车载 AI 计算平台和自动驾驶软件整合进集团的软件定义汽车(SDV)架构,优先加速落地:搭载英伟达方案、具备 L2+ 能力的量产车目标定在2028年上半年,L2++ 量产车目标定在2028年下半年;同时推动现代、起亚、42dot 和 Motional 共用的传感器系统逐步标准化到 NVIDIA DRIVE Hyperion 10,以提高数据采集与训练利用的一致性。第二条轨是自研路线:AVP 部门与 42dot 联合开发的端到端(E2E)自动驾驶系统 Atria AI 继续推进,同时在开发 Atria 的视觉语言动作(VLA)技术,量产目标是2029年下半年推出 L2++ 车型,能力按真实道路数据逐步迭代。两条轨并行,一条买成熟能力抢时间,一条攒自研能力争长期——这也是全球车企在自动驾驶上最典型的务实打法。

还有一个容易被跳过的细节:Data Union 生态。集团正在基于标准化的传感器架构和数据结构建立 Data Union 框架,目标不是简单地交换原始数据,而是让跨车辆、跨组织产生的数据能够被更广泛地使用。把它和同一天的另一条新闻放在一起看会更有意思——英伟达CEO黄仁勋在高盛大会上把自动驾驶和机器人列为 AI 的下一个增长领域,而现代汽车集团恰好是英伟达在汽车侧最重要的合作伙伴之一。也就是说,物理 AI 这条赛道上,算力厂商和整车厂正在互相借力:前者需要真实的道路数据和量产场景来证明平台价值,后者需要成熟的算力平台来争取时间。这也解释了为什么现代集团要在数据标准和传感器架构上做统一——数据能不能被复用,取决于接口是不是一致的;而接口是谁定的,决定了未来谁在生态里更有话语权。

🤔 常见问题解答

Q1: 数据飞轮(Data Flywheel)具体指什么?

按官方新闻稿的定义,它是一套良性循环:车辆采集的数据用于训练和验证 AI 模型,改进后的模型再部署回车辆,车辆运行产生新的数据,如此往复。关键在于闭环——数据不只是单向流入训练,模型的评估结果还会回流去指导下一轮数据采集和模型开发,从而缩短开发周期、加快模型迭代。集团把它称为自动驾驶竞争力的关键要素。

Q2: L2+ 和 L2++ 有什么区别?

这两者都不是国际自动机工程师学会(SAE)标准里的正式等级,而是行业对 L2 级能力延伸的通俗叫法,用来区分同一等级内部的能力强弱。L2+ 通常指在 L2 基础上增加了更复杂场景的辅助能力,L2++ 则再进一步,覆盖更多城市复杂交通场景。需要说明的是,无论加多少个加号,驾驶责任主体仍然是驾驶员,这一点与 L3 有本质区别。现代汽车集团公布的测试画面能力等级就是 L2++,量产时间表上 L2+ 在2028年上半年、L2++ 在2028年下半年(英伟达方案)和2029年下半年(Atria AI)。

Q3: 为什么要用 3D Gaussian Splatting 做虚拟验证?

因为有些边角案例在现实里没法安全复现,也不经济。急刹、突然窜出的行人、极端天气这类场景,靠真实车辆反复触发既危险又低效。把真实道路数据重建为三维环境后,工程可以反复回放和变体这些场景,让模型在大量困难样本上评估;同时还有一个常被忽略的作用——回归验证,即确认新训练的模型没有让原有能力退化。对自动驾驶这种安全关键系统来说,防止能力回退和提升新能力同等重要。

Q4: Data Union 生态解决的是什么问题?

解决的是数据复用的接口问题。各家车企各自采集数据,传感器规格、数据结构和标注口径都不一样,导致同一条道路数据在 A 家能用、在 B 家就要重新处理一遍,规模效应发挥不出来。现代集团的做法是先统一传感器架构与数据结构,再在此基础上建立跨车辆、跨组织的数据使用框架,目标不是交换原始数据,而是让数据能更广泛地被使用。长期看,这类标准化的意义不只是省成本,还关系到未来在产业协作中谁定接口、谁有话语权。

🛠️ 推荐工具

  • 图片压缩 - 处理自动驾驶数据集里的图像样本时,先压缩再上传,能在同样的带宽和存储下多跑几轮实验
  • 单位换算 - 对比不同时区、不同市场的里程、速度与产能数据时,先统一单位再比较,结论才不会跑偏
  • Base64 编解码 - 调试车端与云端之间的传感器数据接口时,用 Base64 快速看一眼原始字节,比翻日志快

这条新闻最值得记住的不是时间表,而是它对竞争力的重新定义:自动驾驶的竞争不再是比较功能,而是比数据量、学习速度和落地效率。这句话放在今天的环境里是有分量的一种表态——真正的压力往往不在算法,而在有没有形成持续获取困难样本的能力。另一个值得留意的是双轨策略的取舍:2028年靠英伟达方案交付,2029年才拿出自研的 Atria AI,中间差了整整一年半。这一年半是拿时间换自主权的代价,说明管理层认可先让客户用上、再谈技术独立的次序。至于数据飞轮这个词,我现在的看法是它更接近一种工程纪律而不是营销词:困难样本挖掘、回归验证、追日开发、统一数据接口,这些听起来都很琐碎,但自动驾驶真正难的地方就在这里。

总结

2026年9月13日,现代汽车集团官方宣布数据飞轮全面投入运行,把车辆数据采集、AI训练、验证与部署串成闭环,并在京畿道42dot总部举办 HMG Autonomous Driving Media Day 公布战略与路线图。数据侧:现代与起亚年销超700万辆、覆盖约190个国家和地区,集团运营约40辆专用数据采集车全天候采集,数据集包含施工区、恶劣天气、紧急机动等长尾边角案例。技术侧:困难样本挖掘、持续训练流水线、基于三维重建与 3D Gaussian Splatting 的虚拟验证、韩美两地追日式开发、Special Event Recorder(SER),以及基于标准化传感器架构与数据结构的 Data Union 生态。产品侧为双轨策略:与英伟达合作,搭载 NVIDIA DRIVE Hyperion 10 的 L2+ 量产车目标2028年上半年、L2++ 目标2028年下半年;自研端到端系统 Atria AI 及其视觉语言动作(VLA)技术,L2++ 量产目标2029年下半年。发布会同时公开了 Atria AI 测试车在复杂城市交通中无人工干预行驶的 L2++ 画面。主要来源:现代汽车集团官方新闻稿(hyundai.com)、Unite.AI。

来源链接:Hyundai Motor Group 官方新闻稿 · Unite.AI