打开APP

现有路径不通?OpenAI、亚马逊考虑改变大模型训练方式

人工智能领域竞争激烈,顶尖研究人员质疑现有模型训练范式,探讨新训练模式,这将改变开发格局,市场已现分化迹象,同时硬件创新加速,行业整合活跃。

随着人工智能领域竞争进入深水区,行业顶 尖研究人员正对现有的模型训练范式提出质疑。

来自OpenAI、Thinking Machines Lab以及亚马逊的研究人员正在探讨一种根本性的转变:放弃目前通用的“先预训练、后后训练”的标准流程,转而采用针对特定任务更早引入精选数据的训练模式,以解决现有模型的效率低下和“裂脑问题”等缺陷。

这一潜在的转变由亚马逊的David Luan等人大力倡导。其核心观点在于,目前的通用训练路径——即先赋予模型广泛的世界知识(如诗歌或园艺),再针对特定任务(如代码编写或客户退款)进行微调——在逻辑上并不总是合理的。研究人员认为,如果模型的最终用途已经确定,那么在预训练阶段就应引入与任务高度相关的精选数据,从而更直接地为最终目标服务。

这种方法论的调整若付诸实践,将深刻改变AI行业的开发格局。这不仅意味着开发团队可能不再需要按照预训练和后后训练进行人为分割,更预示着市场将从“一个通用模型适应所有场景”走向“基于不同数据集构建专用模型”的时代。这种转变将迫使开发者在训练初期就对数据进行更严格的筛选,从而决定模型在特定领域的专长与短板。

市场已经出现了这种分化的迹象。OpenAI目前正通过路由器将ChatGPT的查询分流至不同模型处理,并开发了如GPT-5-Codex等专用模型。这种策略反映出消费者对简单聊天机器人的需求,与公司追求超级智能、科学研究(如火星殖民或疾病治疗)等高端目标之间存在巨大差异。若进一步深化这一路线,OpenAI可能需要彻底重组其研究团队以适应完全不同的模型训练需求。

01

重塑训练逻辑:摒弃通用冗余

目前的AI训练规范在某种程度上模仿了人类的学习过程,即在童年时期积累广泛的基础知识,随后学习特定技能。然而,行业内部开始反思这一流程的效率。David Luan指出,对于一个旨在处理代码或客户服务的模型而言,花费大量算力去学习完全不相关的领域(如诗歌或园艺)是一种资源浪费。

这种“广撒网”式的预训练虽然直观,但也导致了诸如“裂脑问题”等技术瓶颈,即模型可能仅因提问方式的不同而给出错误的答案。新的思路主张将预训练过程用于接触与既定任务更相关的精选数据。OpenAI和Thinking Machines Lab的研究人员对此表示认同,部分人士甚至建议取消不同训练阶段的独立团队,将人员整合为一个统一的训练团队,以提高针对性。

02

专用模型崛起与组织重构

这一变革将对AI模型的最终形态产生深远影响。研究人员必须在训练早期就决定纳入哪些数据,这将直接决定模型的能力边界。例如,在早期训练中增加数学和代码数据而减少散文数据,可能会造就一个卓 越的编程助手,但牺牲其在创意写作或与用户情感交流方面的能力。

这将导致未来AI市场不再依赖于对同一个预训练模型进行后期修补,而是涌现出大量基于不同基础数据集训练的专用模型。据OpenAI内部情况,公司已经意识到这种需求分化。一方面是消费者希望ChatGPT回答简单问题并充当聊天伙伴,另一方面是公司致力于推理模型和超级智能的前沿研究

。目前,OpenAI虽然所有模型仍基于同一预训练模型,但已通过路由技术和特定版本(如GPT-5-Codex)来应对这种复杂性。如果未来转向为不同目的训练完全独立的模型,将要求公司对研究团队进行彻底的重组。

03

硬件突破与资本押注

在软件训练模式酝酿变革的同时,硬件领域的创新也在加速,资本正密切关注能提升能效的新技术。光子芯片初创公司Neurophos刚刚完成了由比尔·盖茨旗下的Gates Frontier领投的1.1亿美元A轮融资,微软旗下的风险投资公司M12也参与其中。

Neurophos致力于设计利用光而非电子进行AI数学运算的芯片。据该公司联合创始人兼CEO Patrick Bowen介绍,其目标是在2028年交付一款芯片,其速度和效率将是英伟达Blackwell芯片的50倍。微软高管Marc Tremblay表示,现代AI推理对电力和算力的需求巨大,行业需要计算层面的突破。

与此同时,OpenAI也在加强自身的基础设施建设。OpenAI首席财务官Sarah Friar在世界经济论坛上透露,该公司的定制推理芯片正在进行“流片”,即制造前的最后一步。她还表示,去年宣布的价值超过5000亿美元的Stargate基础设施项目已建成过半,且“进展超乎想象”,公司已在甲骨文的Stargate园区服务器上训练模型。

04

行业整合与竞争动态

AI领域的并购与融资活动持续活跃。据The Information数据,旨在定制AI模型的软件公司Lightning AI与数据中心提供商Voltage Park合并,新公司估值超过25亿美元。此外,Yelp同意以3亿美元收购AI代理初创公司Hatch。谷歌DeepMind则通过许可协议聘请了语音AI初创公司Hume AI的CEO及多位顶 尖工程师。

在巨头动向方面,据彭博报道,苹果正与谷歌谈判,计划利用其云基础设施及TPU芯片来推出更新版的Siri,并计划最早于2027年推出AI驱动的可穿戴设备。英伟达CEO黄仁勋据报正准备前往中国,试图在这个战略市场重新站稳脚跟。

在监管与伦理层面,Anthropic发布了Claude的新版“宪法”,相比2023年的初版,新文件减少了指令性,给予模型更多判断空间,并罕见地提及了模型可能具有某种“意识”或“道德地位”的可能性。白宫经济顾问委员会则发布报告预测,生成式AI将引发美国经济的深刻转型,有望显著提振生产力和增长。

【本文由投资界合作伙伴微信公众号:硬AI授权发布,本平台仅提供信息存储服务。】如有任何疑问题,请联系(editor@zero2ipo.com.cn)投资界处理。

相关资讯

相关企业

AI数据总览

红熊AI上海算模算样科技有限公司
融资时间2026-07-20 当前轮次A+轮 融资金额数千万人民币
AI
涉及机构: 九纬基金彰宜资产格睿丰
记忆张量记忆张量(上海)科技有限公司
融资时间2026-07-20 当前轮次Pre-A轮 融资金额亿级人民币
AI
涉及机构: 哈勃投资荣耀商汤国香资本深创投和玉资本
面壁智能北京面壁智能科技有限责任公司
融资时间2026-07-15 当前轮次D++轮 融资金额数亿人民币
AI
涉及机构: 国家级基金央企汽车制造商等各类产业方知名财务投资人
帷幄杭州帷幄未来科技有限公司
融资时间2026-07-15 当前轮次C+++轮 融资金额4000万美元
AI
涉及机构: 招银国际(CMB International CMBI) 旗下专注于 AI 及前沿科技的基金日本三井住友银行 (Sumitomo Mitsui Banking Corporation SMBC) 旗下企业风险投资基金 SARF (SMBC Asia Rising Fund)三菱 UFG (MUFG) 旗下泰国大城银行 (Bank of Ayudhya) 企业创投 (CVC) 平台 Krungsri Finnovate弘章投资 (Charisma Partners)韩国现代汽车集团 (Hyundai Motor Group) 新加坡电信 (Singtel Innov8)
知有无界知有无界(深圳)智能科技有限公司
融资时间2026-07-15 当前轮次天使+轮 融资金额数千万人民币
AI
涉及机构: 元禾璞华深圳新产投

最新资讯

热门TOP5热门机构 | VC情报局

去投资界看更多精彩内容
【声明:本页面数据来源于公开收集,未经核实,仅供展示和参考。本页面展示的数据信息不代表投资界观点,本页面数据不构成任何对于投资的建议。特别提示:投资有风险,决策请谨慎。】