周二盘后,特朗普在白宫发表讲话。他表示,OpenAI、软银和甲骨文联合成立“星际之门(Stargate)”项目,在人工智能基础设施方面至少投资5000亿美元,创造10万个工作岗位。特朗普称其是“历史上最大的人工智能基础设施项目”。Arm、微软、英伟达、甲骨文、OpenAI将是美国StargateAI项目初始技术合伙人。
1月20日,月之暗面推出多模态思考模型Kimik1.5,DeepSeek开源R1推理模型,双双“硬刚”OpenAI。性能测试显示,这两款模型在多项测试中能与o1“叫板”。R1更是得到英伟达高级研究科学家JimFan等一众业界大佬的称赞。不过,R1与开源模型V3一样,面临着幻觉问题。
当地时间1月17日,OpenAICEO阿尔特曼在X上透露,o3-mini推理模型预计几周内推出,表现“非常出色”。他还表示,希望2025年合并GPT系列和o系列。对于GPT-5,阿尔特曼称仍在确定中。AI专栏作家Romero猜测GPT-5或已开发完成,OpenAI可能参考竞争对手做法,将其用于模型蒸馏提升其他模型性能,也许永远不会公开发布。
美东时间1月15日,微软宣布推出Microsoft365CopilotChat,面向商业客户。该服务基于网页提供GPT-4o支持的AI聊天工具,企业用户可通过Fileuploads功能处理文档等,CopilotPages功能允许实时协作处理内容。智能体服务可自动执行重复性任务,按用量收费。
1月15日,科大讯飞发布发布国内首个基于全国产算力平台训练的具备深度思考和推理能力的大模型——讯飞星火深度推理模型X1。深度思考与逻辑推理能解决训练成本高、乱答题等问题,成为模型发展决胜关键。目前,推理模型在数学、医疗等领域表现出色,已产生真实价值,如让AI学习机学习推荐和诊断更精准等。
当地时间1月13日,英伟达传出坏消息,其最新AI芯片Blackwell机架因过热和连接故障,导致微软、亚马逊和谷歌等大客户削减部分订单。此前,该芯片还曾陷入设计缺陷争议并延期交付。分析师郭明錤称,英伟达GB200NVL72机架的出货量或将显著低于预期,汇丰银行则预计英伟达GB200供应链问题将延续到2026财年上半年。
马斯克在最新采访中透露,特斯拉在2025年将生产数千台Optimus人形机器人,并在工厂初步测试。如果一切进展顺利,2026年人形机器人产量将增加10倍,后年再增加10倍,届时产量至少50万台起。德银预计,到2035年,特斯拉来自Optimus的年收入将达到100亿美元,Optimus销量将达到20万台。
1月7日,大模型创业公司零一万物CEO李开复回应媒体称,只有大厂能够烧超大模型,零一万物2024年以来的目标,是做小参数、适中的行业模型。如今,李开复的最新回应也意味着零一万物未来更专注“产业大模型”和应用落地,将“超大模型”预训练交给产业大模型联合实验室。
北京时间1月7日上午,英伟达创始人兼CEO黄仁勋在拉斯维加斯举行的CES2025大会上发表主题演讲,宣布推出一系列新产品和技术。其中,售价高达1999美元的RTX5090显卡成为焦点,这款基于Blackwell架构的顶级GPU性能比上一代高出2倍。其他“王炸”产品还包括Cosmos世界基础模型、下一代汽车处理器Thor,以及将于5月推出的个人AI超级计算机ProjectDigits。
2024年12月26日,AI大模型DeepSeek-V3发布并同步开源,全球刷屏。DeepSeek-V3在聊天机器人竞技场中排名第七,是前十名中唯一的开源国产模型,且被评为性价比最高的模型。技术报告揭示其融合了FP8、MLA、MoE三项创新技术,大幅提升了性能和效率。业内人士认为,这些技术的应用标志着实质性突破。
2024年,中国AI应用纷纷“出海”,并在视频生成、陪伴式AI和AI教育等赛道取得了不俗的成绩。数据显示,3款中国出海AIApp和12款Web端AI应用月度活跃用户数超千万,显示了中国AI应用在全球市场的强劲势头。业内人士认为,AI应用本质上就是全球化的产品。出海是AI应用的必选之路。
美东时间1月2日,特斯拉公布其2024年销量为178.92万辆,同比下降1.1%,为10多年来首次下滑。受此影响,特斯拉股价大跌6.08%,市值一日蒸发788亿美元。然而,华尔街机构对其长期叙事仍有信心。Wedbush分析师DanIves认为,特斯拉1万亿美元的AI估值已开始释放,未来12~18个月内有望达到2万亿美元估值。
深势科技创始人孙伟杰在接受《每日经济新闻》记者专访时指出,AI4S提供了高效的“挖掘机”工具,将传统科研从随机探索转变为相对确定的过程,极大提升了科研效率。他认为,未来科研将主要在云端进行,实验操作将像使用手机应用一样简便。AI4S基于严谨的科学规律,不存在大语言模型常见的“幻觉”问题。孙伟杰预测,近两年,至少会产生AI4S的下游公司,也就是“挖到矿”的公司。
深度求索DeepSeek-V3模型在业界掀起波澜。据悉,该模型采用数据蒸馏技术,将复杂数据简化为高质量数据,提升了训练效果。然而,有学者指出,蒸馏技术虽能提高效率,但可能导致“学生模型”无法超越“教师模型”,甚至影响创新。此外,DeepSeek-V3曾出现“自称是ChatGPT”的幻觉问题,引发外界对其训练数据来源的质疑。专家强调,确保高质量AI的关键在于提供真实世界的高质量数据。
每经杭州12月31日电(记者叶晓丹)12月31日,阿里云宣布本年度第三轮大模型降价,通义千问视觉理解模型全线降价超80%。其中Qwen-VL-Plus直降81%,输入价格仅为0.0015元/千tokens,创下全网最低价格;更高...
12月26日,DeepSeek-V3上线并同步开源。国外独立评测机构指出,DeepSeek-V3超越了迄今为止所有开源模型。在强大的性能之外,DeepSeek-V3两个月的训练成本仅为558万美元,多位技术大佬亲自下场点赞。与此同时,有一个bug引发热议:DeepSeek-V3竟声称自己是ChatGPT。