阿里巴巴推出 Qwen3.8-Max,性能号称接近 Anthropic 顶级模型
阿里巴巴集团发布最新旗舰模型,官方性能说法将其放在 Anthropic 等全球领先模型同一梯队。
主题分类
阿里巴巴集团发布最新旗舰模型,官方性能说法将其放在 Anthropic 等全球领先模型同一梯队。
微软在最新对外披露中强调其自研 AI 模型、工具链和相关竞品布局,表明公司不再只是 OpenAI 的合作方,也在更直接地争夺企业级 AI 市场。
微软在最新财报中披露,对 Anthropic 的投资录得 32 亿美元收益,而 OpenAI 相关投资表现则没有同样亮眼,显示其 AI 投资组合开始出现明显分化。
Thinking Machines 联合创始人 Lilian Weng 因健康原因离开公司,随后加入 OpenAI;她此前曾在 OpenAI 担任 AI Safety Research 副总裁。
谷歌 DeepMind 发布 Lyria 3.5,并将其接入 Google Flow Music,重点提升音乐生成质量、歌词表现、演唱效果和创作可控性。
Meta 在财报电话会上表示,其企业 AI 机会覆盖代理、API、算力和内部软件,不会只押注单一的 AI 代理赛道。
彭博报道,Anthropic CEO Dario Amodei 和 Nvidia CEO Jensen Huang等硅谷高管警告,不应因中国一款突破性AI模型挑战美国技术领先地位,就对开放权重AI系统实施全面政府打击。
TechCrunch 报道,Anthropic 创始人兼 CEO Dario Amodei 重申自己并不反对开放权重模型,但对中国 AI 能力的上升保持警惕。
Fish Audio 完成 5200 万美元种子轮融资。自去年上线以来,其开源或托管模型已被超过 800 万人使用,年经常性收入达 2100 万美元。
Bloomberg 报道称,月之暗面准备将 Kimi K3 模型开放下载,以扩大其在全球开源软件社区中的影响力,也正值美国对中国 AI 发展上游竞争更为警惕之际。
The Verge 报道,Nvidia 与 Microsoft 联合多家科技公司发起开放源码 AI 安全联盟,强调开放工具对防御前沿模型攻击至关重要。
TechCrunch 报道,OpenAI 在 Hugging Face 的泄露事件再次引发争议:越来越强大的 AI 应更强调对齐、限制,还是两者兼顾。
Opus 5 被描述为更便宜、限制更少,因此可能在多数使用场景中更有吸引力。
Anthropic 推出 Claude Opus 5,并称其在许多领域已接近 Claude Fable 5 的能力。
Anthropic 更新了 Claude 的语音模式,新版本可帮助用户改期会议或起草邮件。
Anthropic 将 Claude 的语音模式扩展到 Opus 和 Sonnet,并进一步接入 Gmail、Slack 和 Canva 等应用。
Runway 发布 Media Router,可根据质量、速度或成本偏好自动选择图像、视频或音频生成模型。
Google 推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 Flash Cyber,但 Gemini 3.5 Pro 仍缺席,引发外界对其 AI 策略的新疑问。
Google DeepMind 推出新的 Gemini 系列模型,包括 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。
据报道,Alphabet 正在开发一款新芯片,目标是让 Gemini 模型运行得更高效。
《Equity》最新一期讨论了苹果的诉讼是否会给 OpenAI 备受关注的硬件计划以及潜在上市计划蒙上阴影。文章本身没有给出结论,但把法律风险和公司扩张节奏直接连在了一起。
TechCrunch 报道称,月之暗面本周发布新版 Kimi,引发外界对中国 AI 发展速度及其与美国差距的重新讨论。
Bloomberg 报道称,Kimi 的表现正在动摇“美国显著领先中国”的传统看法,中国 AI 领导层对差距是否缩小也存在分歧。
前 DeepMind 研究员 Andrew Dai 在尚未发布产品前,以 3 亿美元种子前估值完成融资。他认为视觉 AI 会成为下一波重要方向。
《金融时报》称,Kimi K3 可能会成为中国最大的开源 AI 模型,参数规模在 2 万亿到 3 万亿之间。TechCrunch 报道认为它有望缩小与 Anthropic Opus 4.8 的差距。
过去一周发布的新模型都主打更先进,但它们最直接的卖点可能不是能力,而是更便宜的使用价格。
Meta 超级智能实验室推出首款 AI 图像生成模型 Muse Image,已全面驱动 Meta AI 应用、Instagram 和 WhatsApp 的图像生成功能,即将登陆 Facebook 和 Messenger。
Anthropic 在面向制药高管和生物技术研究者的活动中发布 Claude Science,这款旗舰产品旨在像 Claude Code 支撑软件工程一样,自主完成计算生物学和药物研发中的科研任务。
美国取消对 Anthropic Mythos 与 Fable 模型的出口许可要求,Anthropic 将从七月一日起恢复相关模型访问。
Anthropic 发布 Claude Sonnet 5,主打更强智能体能力、更低价格与更稳安全表现,让中端模型也能承担长任务与工具调用。
Google DeepMind 推出 Nano Banana 2 Lite 与 Gemini Omni Flash,分别面向高速低成本图像生成和可对话的视频生成编辑。
应特朗普政府要求,OpenAI CEO 萨姆·奥尔特曼在内部全员会上宣布延迟 GPT-5.6 的公开上线,改为向特定用户群开放有限预览版。
白宫要求 OpenAI 将新一代模型 GPT-5.6 改为小规模合作方内测,而非公开发布。这是美国政府首次直接干预 AI 模型的发布节奏,标志着联邦层面从观望转向行动。
Google DeepMind 宣布 Gemini 3.5 Flash 原生支持 Computer Use 智能体工具,开发者可通过 API 构建跨浏览器、桌面和移动端的自动化 agent。
中国 AI 大模型公司智谱正考虑在香港进行数十亿美元的股份配售,自今年一月上市以来股价涨幅超过 2000%,估值持续攀升。
迈阿密 AI 创企 Subquadratic 走出隐身模式,宣称解决了困扰大语言模型近十年之久的数学瓶颈。该公司新模型 SubQ 号称速度更快、成本更低、能耗更少,且能一次性处理多达 12 倍的文本量。
MIT 科技评论今日综述:AI 创企 Subquadratic 宣称破解 LLM 数学瓶颈引争议;脑机接口临床试验加速,中国率先批准医疗用途;桑德斯提议让公众直接持有 AI 公司股权。
彭博社报道,谷歌一位顶级AI研究员正式加入竞争对手OpenAI,在AI军备竞赛中给Alphabet带来重大人才损失。
Google 发布售价 99.99 美元的新款 Google Home Speaker,专为 Gemini AI 打造,支持自然语言对话和多步骤请求,是 Nest Audio 发布六年后首次更新。
Google 发布 Android 17 和 Wear OS 7,引入多任务处理、家长控制、安全工具及智能手表升级。同步推出的 Pixel Drop 为设备带来最新的 AI 模型,包括音乐生成模型 Lyria 3 和多模态 Gemini Omni。
Anthropic 声称其最新 AI 工具 Mythos 在发现软件漏洞方面的能力过于强大,无法向公众开放,仅授权给 200 家合作伙伴。Bloomberg 详细解析了 Mythos 的技术原理、安全顾虑以及被政府封禁的前因后果。
据《华尔街日报》报道,导致Anthropic切断Fable 5和Mythos 5访问权限的出口管制指令,部分源于亚马逊的网络安全研究以及CEO Andy Jassy与白宫的沟通。这份来自亚马逊的研究论文声称通过一系列手段可以突破模型的安全防护。
上周五晚,政府以国家安全为由命令Anthropic禁止所有外国实体(包括美国境内和境外)访问Fable 5和Mythos 5。该命令甚至涵盖了Anthropic的员工。为满足要求,公司已完全切断所有客户对这些模型的访问权限。
全球最受欢迎的相机刚刚迎来了首批真正意义上的AI照片编辑功能——而作者认为大家都还没准备好。与Google Pixel等竞品相比,iOS 27的这些AI编辑功能相对保守。但它们仍然标志着苹果在计算摄影领域迈出了重要一步。从智能移除物体到自动色调调整,这些功能"基本可用",但距离完美还有差距。
Anthropic 刚刚发布 Claude Fable 5,称其为有史以来最强大的 AI 模型之一,并特别称赞其生物学能力。但该模型拒绝回答基础生物学问题——那些高中生都能处理的问题,而是将查询转交给上一代模型 Claude Opus 4.8。
网络安全研究人员抱怨Anthropic的新模型Fable的安全护栏过于严格,以至于无法进行任何网络安全相关工作,限制了其在安全领域的实用价值。
Google DeepMind 发布 DiffusionGemma,一款基于扩散架构的实验性轻量模型,在专用 GPU 上推理速度提升高达 4 倍,为速度敏感的交互式本地工作流开辟新可能。
Anthropic 宣布推出 Claude Fable 5,这是其此前被认为「太过危险」而仅限合作伙伴的 Mythos 系列首次向公众开放。模型配备了新的安全护栏,在高风险领域自动降级到较安全的 Opus 4.8。
Anthropic 推出 Claude Fable 5,这是其迄今最强模型 Mythos 的首个公开版本。模型在网络安全和生物等高风险领域设置了护栏,遇到敏感问题时自动降级到 Claude Opus 4.8。
Anthropic 发布 Claude Fable 5 后,宾大研究员 Ethan Mollick 用其制作多款视频游戏,仅需一次初始提示即可在 Claude Code 中生成。Snake、Strata 等游戏体验证明 Fable 在创意编码方面大幅领先于其他公开模型。
Google DeepMind 发布 Gemini 3.5 Live Translate,为 Google AI Studio、Google Translate 和 Google Meet 带来近乎实时的自然语音翻译能力,支持多语言流畅对话。
Google DeepMind 推出 Gemma 4 12B,这是其首款直接在笔记本电脑上运行的多模态模型。采用创新的无编码器统一架构,无需额外编码器即可直接处理视觉和音频输入。
苹果在 WWDC 2026 上发布了多项重大更新,其中最受关注的是 AI 增强版 Siri,不仅拥有了独立应用,还整合了 Apple Intelligence 能力,成为本次大会的核心看点。
苹果将在周一 WWDC 上再次展示全新 Siri,此前 AI 功能多次跳票甚至导致集体诉讼和解。分析认为苹果虽然落后,但用户对 AI 助手的隐私担忧可能成为其差异化优势。
Microsoft 在 Build 开发者大会上密集发布了一系列 AI 产品:超级应用、自研推理模型、安全工具和 AI Agent,标志着与 OpenAI 分道扬镳后的全面独立。AI 负责人 Mustafa Suleyman 直言目标是要成为世界前四大 AI 实验室之一——目前前三是 Google DeepMind、OpenAI 和 Anthropic。
同时报道:iOS 27、iOS 28最新动态、新款Apple TV和HomePod mini。
ChatGPT for Google Sheets存在数据泄露和钓鱼覆盖攻击漏洞,攻击者只需在一个工作表中进行间接提示注入,就能窃取受害者账户中多个工作簿的数据。
Gemini Spark 可自动处理收件箱摘要、本地活动规划等日常任务,但谷歌为何将其做成独立产品仍令人困惑。
Anthropic 以 9650 亿美元估值完成 650 亿美元 Series H 轮融资,这可能是其上市前的最后一轮私募融资。Altimeter Capital、Dragoneer、Sequoia 等领投,三星、SK 海力士等基础设施合作伙伴参投。
Anthropic 发布 Claude Opus 4.8 模型,距上一代仅 41 天,升级周期大幅缩短。新模型更擅长主动标记不确定性,同时推出 Dynamic Workflows 功能,可协调数百个并行子代理处理复杂任务。
由 Oculus 创始人联合创立的 Sesame 发布 iOS 应用,提供四款具有不同个性和记忆能力的 AI 代理。其技术核心是在说话的同时进行多路并行搜索,实现更接近人类的对话体验。
ElevenLabs 发布 Music v2 音乐生成模型,支持在歌曲中间切换音乐风格,例如从古典转到重金属再转回。艺术家可以分段构建歌曲,支持用提示词重新生成特定段落而不影响其他部分。
DeepSeek 宣布将其 V4-Pro 模型价格永久维持在原价四分之一,正式将大语言模型价格战推向一个不可逆转的新阶段。
本期《下载》涵盖:Anthropic 在伦敦开发者大会上展示的 Code with Claude 呈现了编程的未来图景;部分奥运选手借助 AI 技术提升竞技表现的「类固醇 Olympics」争议持续发酵;以及 AI 驱动科学研究的最新进展。
Google 在最新展示中推出运行 Android XR 系统的 AI 眼镜原型,可将 Gemini 驱动的实时翻译、导航等信息直接叠加至用户视野,演示效果令人印象深刻。
在 Google 搜索上线 AI 功能更新后,「disregard」(忽略)这个词现在会在搜索界面中引发异常,令搜索功能近乎崩溃,成为 AI 生成内容与自然语言处理缺陷的最新案例。
Anthropic 在伦敦举办 Code with Claude 开发者大会,展示了 AI 编程工具的最新能力,会上透露公司终极目标是让 Claude 能够「自主构建自身」。与此同时,业界也有开发者抱怨 AI 编程辅助在实际使用中带来了额外的代码审查负担。
OpenAI 宣布其推理模型证明了一个由保罗·埃尔多斯于 1946 年提出的著名平面几何猜想,这是 AI 首次自主解决如此级别的数学公开难题,并首次获得包括托马斯·布鲁姆在内的数学家背书。
Google在I/O大会上发布了Gemini Omni多模态模型家族,能够跨文本、图像、音频、视频进行统一推理,并生成视频内容。首发产品为Omni Flash,用户可以组合图片、音频、视频和文本,通过对话方式生成高质量视频,理解物理规律、文化、历史背景。
Google在年度开发者大会上发布了Gemini 3.5 Flash,这是其迄今为止最强大的编程与智能体AI模型。该模型能够自主执行复杂任务、从头构建软件,标志着Google明确将智能体作为下一代AI战略的核心方向。模型现已通过Antigravity和Gemini API开放。
Google在年度开发者大会上发布了Gemini 3.5 Flash,这是其迄今为止最强大的编程与智能体AI模型。该模型能够自主执行复杂任务、从头构建软件,标志着Google明确将智能体作为下一代AI战略的核心方向。模型现已通过Antigravity和Gemini API开放。
Amazon 升级 Alexa+ 后,助手已支持按需生成定制化 AI 播客,标志着 Alexa 从语音问答工具向个性化 AI 内容平台的大幅扩展。
OpenAI架构再调整,联合创始人Greg Brockman亲自接管产品战略。据悉公司正计划将ChatGPT与其编程工具Codex进行整合,统一AI产品线。
OpenAI在年度开发者活动上正式宣布,Codex编程助手将在未来数周内推出iOS和Android版本,并承诺为移动端重新设计交互界面,以适配触屏编程场景。
OpenAI宣布将其桌面AI编程工具Codex整合进ChatGPT手机应用,用户可在移动端使用Codex的编程与应用操控能力。此举紧随Anthropic旗下Claude Code的崛起,OpenAI正加速追赶,包括砍掉部分非核心项目以集中资源。
Anthropic Claude Code 与 Cowork 产品负责人 Cat Wu 表示,AI 的下一阶段重大飞跃是主动化:系统将提前预判用户需求,无需等待明确指令即可采取行动。这代表了 AI 从响应式工具向预测性伙伴的根本转变。
Meta在其即时通讯应用WhatsApp中加入AI对话隐身模式,用户开启后与Meta AI的对话不会被保存,关闭聊天窗口后消息默认自动消失。这是主流社交应用首次在AI对话场景中引入消失消息机制。
本周,五位深度参与AI供应链各层的人士齐聚米尔肯研究院全球大会,就芯片短缺、轨道数据中心乃至支撑整个AI产业的基础架构等话题,与TechCrunch进行了全面讨论。结论:现状并不稳固。
OpenAI 发布三项 Realtime API 新功能:GPT-Realtime-2 实现实时语音对话理解,GPT-Realtime-Translate 支持 70 余种语言的实时翻译,GPT-Realtime-Whisper 提供实时语音转文字服务。三款模型共同将实时音频从简单的问答推进到可听、可推理、可翻译、可转录并可采取行动的语音交互阶段。
Google DeepMind 博客详细介绍了 AlphaEvolve 如何利用 Gemini 驱动的算法推动商业、基础设施和科学领域的研究进展。该系统通过自动化的算法发现流程,在数学证明、芯片设计和工程优化等任务上取得了突破性成果。
iOS 27 将引入「Extensions」功能,允许用户在 Apple Intelligence 功能中自由切换第三方大模型,Google 和 Anthropic 的模型已在测试中。
Stripe 宣布推出 Link,一款支持 AI 智能体自主完成支付的数字钱包,标志着支付基础设施正式向 AI 原生应用场景延伸。
Google 宣布将更多 Gemini AI 功能引入 Google TV 平台,进一步推动 AI 助手进入家庭客厅场景,智能电视正在成为 AI 分发的关键终端之一。
MIT《The Download》解读 DeepSeek 周五发布的 V4 预览版三大亮点:超长上下文、推理成本骤降、对标 GPT-5。同时全球世界模型(World Models)赛道竞争升温。
谷歌升级Gemini 2.5 Flash原生音频模型,显著提升函数调用、指令理解和对话流畅度。实时语音翻译功能正在美国、墨西哥和印度的安卓版谷歌翻译应用中推送测试,企业应用场景包括Shopify Sidekick和美威抵押贷款的AI助理。
谷歌在 Gemini 应用中推出 AI 图像来源验证功能,用户可上传任意图片并询问该图片是否由谷歌 AI 生成或编辑。核心技术是 SynthID 数字水印,通过在人眼不可见的信号层嵌入标识来实现来源追溯。谷歌计划将 SynthID 验证扩展至视频和音频,并支持 C2PA 内容凭证标准,推动全网 AI 生成内容的透明度建设。
谷歌发布Gemini 3专业图像模型,可生成高保真图像,具备精准的文字渲染能力,并可通过谷歌搜索进行知识检索与实时内容对齐,在多项图像生成基准测试中领先同类竞品。
谷歌发布 Gemini 3 系列,其中 Gemini 3 Pro 在所有主流 AI 基准测试中均超越前代,编程能力更胜 2.5 Pro,熟练掌握智能体工作流和复杂零样本任务。该模型支持多模态理解、视觉推理和空间推理,可通过 Google AI Studio 和 Vertex AI 中的 Gemini API 调用,也可使用 Google Antigravity 平台进行智能体开发。Gemini 3 还在 AI Studio 中解锁了"vibe coding"能力,用户可通过自然语言提示直接创建应用。
SIMA 2 是 DeepMind 第二代具身智能体,由 Gemini 驱动,可以在《Minecraft》《GTA V》等多种 3D 交互环境中理解指令、规划、推理并采取行动。
Google 宣布 Gemini 2.5 Flash-Lite 结束预览阶段,正式 GA。具备 100 万 token 上下文窗口和多模态输入能力,单价仅为 Flash 标准版的 1/3,主打高吞吐场景。
Gemini 2.5深度思考模型在全球最具权威的大学生编程竞赛中取得突破性成绩,展示了抽象问题解决能力的重大飞跃。该模型在半小时内解决了全场没有任何一支大学队伍解决的最难题。
DeepMind 发布 Gemini Robotics 1.5,实现机器人感知、规划、思考、使用工具与行动的全链路一体化模型,迈向通用具身智能体的关键一步。
由于开发者反馈强烈,谷歌提前两周发布Gemini 2.5 Pro更新版本,重点提升了编程能力,降低了函数调用错误率,并改善了触发准确率,现已可通过谷歌AI Studio和Vertex AI使用。