就在刚刚,硅谷 AI 圈上演了一出「火星撞地球」。
OpenAI 和 Anthropic 像约好了一样,同时甩出了自家的重磅更新:Claude Opus 4.6 和 GPT-5.3-Codex。
如果说昨晚之前,我们还在讨论「怎么写好 Prompt 辅助工作」;那么今天凌晨,我们可能被迫要学会「如何作为老板去管理 AI 员工」。
AI 造 AI,顺便接管你的电脑
就在昨天,Sam Altman 刚在 X 平台上凡尔赛了一把 Codex 的「百万活跃用户」里程碑。短短一天后,OpenAI 再次乘胜追击,扔出王炸——GPT-5.3-Codex。
技术文档里藏着一句极具分量的话:「这是我们第一个在创造自己的过程中,发挥了关键作用的模型。」
说人话就是:AI 已经学会了自己写代码、自己找 Bug,甚至开始自己训练下一代的 AI 了。这种自我进化能力,也直接体现在了一连串跑分数据上。
还记得那个模拟人类操作电脑的 OSWorld-Verified 基准测试吗?前代模型只有 38.2% 的准确率,连及格线都够不上。
但这次,GPT-5.3-Codex 直接跳涨到了 64.7%!
要知道,人类的平均水平也就 72%。这意味着,AI 距离像你一样熟练地甩鼠标、切屏、操作软件,只剩下一层窗户纸的距离。
而在 Terminal-Bench 2.0(命令行操作)中,它更是拿下了 77.3% 的高分,把 GPT-5.2(62.2%)远远甩在身后。
知名 SWE-Bench Pro 基准测试覆盖四种编程语言,不仅抗污染,还全是真实世界的硬核工程难题。
GPT-5.3-Codex 在这里不仅拿下了 SOTA(最高水平),而且用的 Token 比以往任何模型都少。这意味着什么?意味着它不仅干活猛,解决问题的路径还比人类更短、更省钱。
OpenAI 甚至展示了它独立构建的能力:
在几天内,它从零构建了一款包含多张地图的赛车游戏 v2,顺手还搞定了一款管理氧气系统的深海潜水游戏。
最让我印象深刻的是 GPT-5.3-Codex 对模糊意图的理解。
在构建「Quiet KPI」落地页时,它自动把「年度***」换算成了「打折后的月付价格」,甚至还贴心地自动补充了用户评价轮播——这一切,都不需要你下指令。
OpenAI 的野心已经写在脸上了:以前微软常说 AI 将会成为人类的副驾驶(Copilot),但现在 AI 更想做那个能掌控方向盘、甚至能自己修车的司机。
对了,还有一个有趣的细节。
此前外界盛传 OpenAI 对英伟达的 AI 芯片颇有微词,但这次官方博客特地强调:GPT-5.3-Codex 的设计、训练和部署都在 NVIDIA GB200 NVL72 系统上完成。
这一波高情商的「感谢英伟达」,属实是给足了黄仁勋面子。
告别「金鱼记忆」Claude 迎来绝地反击
在 GPT-5.3-Codex 发布的前后脚,Anthropic 也端出了自己的春节大礼包。
坏消息是,大家期待的 Claude「中杯」Sonnet 模型没有更新;但好消息是,Anthropic 直接端出了「超大杯」—— Claude Opus 4.6。
相比于 OpenAI 在「行动力」上的激进,Anthropic 今天发布的 Claude Opus 4.6 则是在「思考力」和「可用性」上死磕。
很多企业用户都有一个名为 Context Rot(上下文腐蚀)的痛点:号称支持 200k 上下文,但塞进去的数据一多,AI 就开始顾头不顾尾。
这次,Claude Opus 4.6 拿出的数据简直是「降维打击」。
在 MRCR v2(长文本大海捞针)测试中,Claude Opus 4.6 的召回率高达 76%。
作为对比,上一代 Sonnet 4.5 只有惨不忍睹的 18.5%。从某种程度上说,这是一个从基本不可用到「高可靠」的质变。
这是 Claude Opus 4.6 首次引入了真正可用的 1M 上下文窗口。
这意味着什么?意味着你可以把几百页的财报、几十万字的代码库直接扔给它,它不仅能读完,还能精准地告诉你第 342 页脚注里的那个数字有问题。
更让打工人眼前一亮的是它的生产力功能。
一方面,Anthropic 这回直接把 Claude 塞进了 Excel 和 PowerPoint。它能根据 Excel 数据直接生成 PPT,不仅保留排版风格,连字体和模板都能对齐。在 Claude Cowork 协作环境中,它甚至能进行自主多任务处理。
另一方面,Anthropic 顺势在 Claude Code 中推出了实验性的 Agent Teams 功能,让普通开发者也能体验这种「指挥千军万马」的感觉:
为了展示 Opus 4.6 的极限,Anthropic 的研究员 Nicholas Carlini 搞了个疯狂的实验:Agent Teams(智能体团队)。
他没有亲自写代码,而是扔了 2 万美元 的 API 额度,让 16 个 Claude Opus 4.6 组成一个「全自动软件开发团队」。
结果在短短两周内,这群 AI 自主进行了 2000 多个编程会话,从零手写了一个 10 万行代码的 C 语言编译器(基于 Rust)。
这个 AI 写的编译器,还成功编译了 Linux 6.9 内核(涵盖 x86、ARM 和 RISC-V 架构),甚至跑通了 Doom 游戏。
虽然它还不够完美(比如生成的代码效率不如 GCC),但这个案例也表明我们不再是和 AI 一起编程,而是看着一个 AI 团队自主协作、查错、推进项目。
此外,它还学会了 Adaptive Thinking(自适应推理),能根据难度自己决定「想多久」。加上新增的「智能强度」控制,你可以在 Low 到 Max 四档之间切换。
定价方面,Anthropic 这次很良心,维持在每百万 Token $5/$25 的基础定价。看来是为了抢占企业级市场,铁了心要和 OpenAI 卷到底。
一个是激进天才,一个是靠谱老牛
知名 AI 评测人 Dan Shipper 在第一时间搞了个「盲测」(Vibe Check),他的评价非常精准:
Claude Opus 4.6 是「高上限,高方差」(High Ceiling, High Variance)。
它像是一个才华横溢但偶尔跳脱的天才。在测试中,它直接解决了一个让 iOS 团队卡了两个月的功能难题;在 LFG Benchmark 中拿到了 9.25/10 的高分。
但它偶尔也会「过度自信」,一本正经地胡说八道。如果你需要突破性的灵感,选它。
GPT-5.3-Codex 是「高可靠,低方差」(High Reliability, Low Variance)。
它像是一个经验丰富、绝不掉链子的资深工程师。推理速度提升 25%,几乎不犯低级错误,稳健得让人心安。
虽然在创造性任务上略逊一筹(LFG 得分 7.5/10),但在日常的 Coding 和运维任务中,它是最高效的老黄牛。如果你需要稳定交付,选它。
时间步入 2026 年,我们的角色开始发生变化。
在这个时间节点,对于普通用户而言,最大的变化莫过于此:Prompt Engineering(提示词工程)的重要性正在下降,而 Agent Management(智能体管理)的能力开始浮出水面。
当 ChatGPT 可以自主修 Bug 甚至操作你的终端,当 Claude 可以一次性吞吐 100 万字并精准定位细节时,我们不再需要像教小学生一样,把指令拆解得碎碎念。
我们需要做的,是学会如何以「管理者」的身份,去定义目标、审核结果、以及——决定在什么时候,把什么任务交给哪位「员工」。
这就是 2026 年的新职场:你的团队里混入了一群硅基天才,而你是唯一的碳基老板。返回搜狐,查看更多
记者从中国时空获悉,基于中国时空服务能力,中国移动、中国电信、中国联通均已推出北斗短信业务,不仅为应急通信、户外出行、日常联络筑牢安全防线,更广泛赋能健康服务、养老服务、儿童保障等多元民生场景。2024年1…...
OpenAI 再不上市,财务窟窿就要把巨头们拖垮了_用户_预测_ChatGPT...
阿里将补贴绑定在具体、高频的“AI点单”行为上,希望能花钱买“使用”,而不仅仅是“安装”。 在这个过程中,让AI帮忙点个奶茶消费门槛不高,但如果涉及更高客单价的商品,AI作为代理介入消费决策时,用户对自身控制…...
首个AI报复人类案例?OpenClaw智能体写“小作文”攻击开源维护者_代码_Scott_Rathbun...
相同的提示词,今天能输出不错的代码,明天给出的就是一堆垃圾,甚至你都不知道是什么原因导致的这种情况。 比较是引诱压力的元凶,尤其是现在互联网时代,所有人都在同步晒自己的AI学习成果,比如“我用AI在两小时构…...
100万颗卫星,撑起马斯克的AI太空基建梦_SpaceX_通信_轨道...
我们将以《指南》为遵循,持续优化自身价格管理与合规体系建设,严格落实明码标价要求、坚决杜绝价格欺诈及不正当竞争行为。当前,汽车行业存在不按规定明码标价、价格欺诈等违法行为,损害消费者和经营者利益,破坏公平竞争…...
从入门到顶级旗舰!vivo宣布旗下多款机型率先支持2亿像素照片微博直发_传感器_影像_功能...
因***内容被罚1.191亿,快手:技术管理、应急处置不及时导致;诚恳接受,坚决整改_平台_同比增长...
9月4日,知乎AI Works项目广场迎来重要更新,在新版本中增加项目一键部署功能。作为一个集项目发布、展示与体验为一体的AI作品交流与实践平台,AI Works旨在助力AI开发者依托知乎数据能力和创作氛围,释放更多创造力。...
xAI又一名联创离职!近一半创始团队成员已出走_公司_Grok_人工智能...
法律层面,可咨询专业律师,明确自己的维权路径,比如向法院提起民事诉讼,要求***者承担赔礼道歉、赔偿损失等民事责任,或配合检察机关追究其刑事责任;平台层面,若隐私影像已被上传,要立即通过平台举报渠道提交投诉,要…...
同时,俞浩更是对马斯克的“火星移民”***进行质疑,指责其动辄宣扬“AI毁灭人类、地球将毁灭需移民火星”是对大众的PUA,实在“太扯淡了”。 俞浩表示,“当然,小马哥(马斯克)不会承认,他会说是自己主动退出的…...
成立于2015年的天数智芯,是国内最早深耕通用GPU领域的企业之一,其招股书显示,天数智芯率先实现国内通用GPU从0到1的突破,并率先成功量产;率先打造训练推理算力的一体化解决方案,把准AI时代的发展脉络。从…...
此次正式发表在Nature的版本中,DeepMind团队不仅完成了全模态性能评估,更在多个疾病变异机制中展示了AlphaGenome的推理能力,包括如何准确预测TAL1致癌突变的激活机制,全面验证了Alph…...
【CNMO科技消息】据中国信通院公布的数据,2025年全年,国内市场手机出货量达3.07亿部,较上一年度下滑2.4%;其中12月出货量仅为2447.3万部,同比大幅下降29.1%。报告显示,2026年中国智能…...
日本宣称:6000米深海挖到稀土了?成本高到离谱!想摆脱中国控制,纯属做梦?_技术难度_海底_淤泥...
过去两年,美股市场曾处于一种近乎狂热的“军备竞赛”逻辑中,投资者将高额的资本支出视为企业拥有AI护城河的标志,甚至奖励那些敢于烧钱购买GPU和建设数据中心的公司。这会给投资者带来一些担忧,也就是说未来美联储…...
能出现在这样的场合,实际上并不容易,每个企业家都是经过慎重筛选的,这一方面显示了国家高层对民营经济和民营企业家的高度重视,另一方面也体现了民营企业家在中外经贸交流中的核心价值,参会的民营企业家,基本上都是中…...
更重要的是,就在前几天外媒@ gtm_ray曝光了一张双摄手持云台相机的照片,正当网友们都认为这就是DJI Pocket4时,影石创新创始人刘靖康在微博上表示「有没有可能不是大疆的」,再结合其个人曾透露过影…...
根据模型的灵敏度(0.87)和特异度(0.96-0.99),论文作者计算了一个***设场景:如果癌症研究中真实的论文工厂论文比例是10%,那么也就意味着在被标记的论文中,约70%确实是论文工厂产物(阳性预测值),…...
对个人用户而言,这项技术意味着照片、***、文件可以真正“永久保存”,不再担心硬盘损坏、数据丢失。数据从“易丢失”变成“可传承”,人类文明的数字记忆第一次拥有了稳定可靠的载体。科技不仅改变生活,更在守护历史,…...
网络世界里,所有标注“免费”的低俗诱惑,都是不法分子量身定制的陷阱,你以为的消遣时光,早已成了他们窃取隐私、收割财产的“***窗口”,一次轻率的点击,就可能让人生轨迹彻底跑偏。不法分子不满足于小额变现,更想直接…...
微软神奇玻璃登上Nature,能将200万本书存储1万年_数据_Silica_技术...
粤IP*******|网站地图粤IP*******|网站地图 地址: 备案号: