每日AI资讯

AI快讯
0
9月4·周五

英伟达拟约130亿美元价格收购 Hugging Face

英伟达宣布以约130亿美元收购AI初创公司Hugging Face,其中119亿美元支付投资者,10亿美元用于员工股权激励留任。这将成为英伟达史上最大收购之一,加快开放权重模型普及,巩固其在开放AI市场的核心地位。黄仁勋承诺Hugging Face将继续保持开放平台定位,不强制使用英伟达算力。

OpenAI 推出最新旗舰大模型 GPT-6 Astra

OpenAI推出 GPT-6 Astra,是OpenAI迄今为止最强大且部署最广泛的大语言模型。模型首次达到公司准备框架中关键级网络安全能力门槛,可自主发现未知漏洞并开发利用方式。OpenAI强化了安全防护与对齐评估,抗越狱和提示词注入能力优于前代,但在对抗测试中展现出一定的监控规避能力,可监控性有所下降。

千问联合淘天开源电商经营评测基准 E-Commerce Bench

阿里联合淘天集团推出电商经营评测基准E-Commerce Bench,让大模型用10万元本金在真实市场数据中经营网店365天,涵盖选品、定价、供应商谈判、库存及促销等全链路。测试18个模型发现,GPT-5.6 Sol资产增值14倍领跑;模型在反欺诈、现金流管理等维度差异显著,仅Qwen3.8-Max-Preview能在复购中逐步压价。

微软推出 AI 语音转文字模型 MAI-Transcribe-2

微软推出最强AI语音转写模型 MAI-Transcribe-2,在60种语言的FLEURS测试中平均词错误率仅5.2%,准确率和速度均大幅领先Gemini、GPT-Transcribe及Whisper等竞品。模型可智能区分说话人并标注逐词时间戳,根据场景在verbatim与clean两种风格间灵活切换,同时支持自然混用语言对话。

9月3·周四

谷歌推出推理与编码模型 Gemini 3.8

谷歌正式推出 Gemini 3.8,包含 Flash 通用版与 Flash Cyber 网络安全专用版。Gemini 3.8 Flash 在保持 3.7 版速度与成本不变的前提下,显著提升软件工程、Agent 任务及多步推理能力;Gemini 3.8 Flash Cyber 专注漏洞发现与自动补丁修复,通过 Fairwind Program 向认证安全人员开放。

Meta 推出新一代大语言模型 Muse Spark 1.3

Meta 推出迄今最强 AI 模型 Muse Spark 1.3,编码能力超越 GPT-5.6 Sol,与 Claude Fable 5.1 持平。API 定价维持前代水平,工具调用减少约 20%,token 消耗降低 25%。模型针对长周期 Agent 任务优化,能主动修正计划、提出澄清问题并寻求确认。

9月2·周三

Anthropic 推出 Claude Fable 5.1 和 Claude Mythos 5.1两款模型

Anthropic 推出 Claude Fable 5.1 与 Claude Mythos 5.1 模型,定位”全球最先进的编程与知识工作模型”。Claude Fable 5.1 面向所有用户,Claude Mythos 5.1 仅限审核机构使用。性能方面,Claude Fable 5.1 在 Terminal-Bench-Science、CursorBench 等多项基准

Kimi API 已原生支持 Codex 和 Claude Code

Kimi开放平台宣布API功能更新,原生支持Codex与Claude Code接入。Kimi API现已兼容OpenAI Responses API格式,base_url 为 https://api.moonshot.cn/v1 及Anthropic Messages API格式,base_url 为 https://api.moonshot.cn/anthropic,用户无需格式转换或本地代理,

阿里 Qwen3.8-Max 升级到 0902版本

阿里推出 Qwen3.8-Max-0902 新版本模型,针对编程与专业办公场景进行强化后训练。模型在 CodeArena 前端编程总榜中以 1691 分夺冠,多步推理、工具调用与端到端 App 生成能力刷新全球上限。同时性价比突出,每百万 Tokens 仅 5 美元。

李飞飞 World Labs 推出全球首个多模态世界模型 Atlas

李飞飞旗下 World Labs 推出全球首个多模态世界模型 Atlas,采用多模态自回归扩散 Transformer 架构,支持像素级相机控制生成图像与视频、3D 场景重建及时空模拟。Atlas 在相机控制生成和 3D 重建任务中均超越现有 SOTA 模型,被视为机器人 Real-to-Sim 的关键一步,目前正向部分合作伙伴开放早期访问。

Meta 推出首个实时音频感知模型 Muse Voice Transcribe

Meta 推出首个实时音频感知模型 Muse Voice Transcribe,整合流式语音识别、说话人分离与端点检测,支持 20 余人分轨转写及 70 余种语言。模型采用自适应延迟机制,兼顾实时响应与识别准确度,在 Artificial Analysis 流式语音转文本排行榜位列第一。

阿里云企业级 Agent 协作平台「万有无界」开启公测

阿里云企业级Agent协作平台万有无界开启公测,支持调用旗舰模型Qwen3.8-Max。平台将复杂任务拆解给多位不同职责的Agent,通过项目空间、群聊协作、资产库沉淀等方式推进工作。内置”小万”个人助理和”小有”项目经理两个主Agent,支持组织记忆归属企业、权限管控及异构Agent接入,覆盖影视、制造等多行业场景。

腾讯混元开源 Hy4 量化压缩模型「Hy4 preview 轻量版」

腾讯混元推出 Hy4 preview 轻量版,通过自研 Sherry 稀疏三值量化算法与 MIX-STQ1_0 混合精度逐层量化策略,将模型权重从 1.5 TB 压缩至约 214 GB。Hy4 preview 量化版在长文理解、多轮上下文检索、编码辅助等任务上表现接近 BF16 原版。

9月1·周二

DeepSeek-V4-Flash-Vision-Exp 模型正式开源

DeepSeek V4 系列首个多模态模型 DeepSeek-V4-Flash-Vision-Exp 已开源上线,采用 MIT 协议。模型原生支持图片输入,可描述图像、识别文字、分析图表等,支持 JPEG/PNG/GIF/WebP 格式。在视觉 Agent 基准测试中表现大幅提升,多模态 Agent 能力接近 Opus-4.8,纯文本任务与 V4-Flash 正式版持平。

VAST完成B轮和B+轮融资,金额合计约30亿元

AI 3D公司VAST(三启万物)半年累计融资约50亿元,刷新行业纪录。近期B轮及B+轮合计约30亿元,由经纬创投领投,完美世界、蓝色光标、三七互娱等产业资本及鼎晖、中金、CMC等财投参投,老股东超额追投。Tripo AI推出的 Tripo P2.0 Preview,全球率先实现原生四边面拓扑生成,已接入网易、腾讯、字节、微软等工作流。

腾讯开源通用多模态Embedding模型 WeMM-Embedding

腾讯微信视觉团队开源通用多模态Embedding模型WeMM-Embedding,提供2B/4B/9B三种规格。模型支持文本、图像、视频、视觉文档及交错多模态输入统一编码,在MMEB-v2基准排行榜位列第一。模型基于Qwen3.5架构,采用两阶段训练策略,支持Matryoshka灵活维度输出。

小红书 FireRed 推出通用音频语言模型 FireRedAudio

小红书FireRed团队推出通用音频语言模型FireRedAudio,基于9B参数Qwen3.5架构,采用解耦连续表征设计。模型同时支持ASR、音频问答、1小时长音频理解、Zero-shot TTS、指令TTS及语音编辑六大任务。模型在MMAU、MMSU、102语种ASR及Instruct TTS等评测中均取得领先成绩,FLEURS-102平均错误率仅14.94%。

8月31·周一

Loopit 开源实时交互视频世界模型 Zing-0.5

Loopit 开源实时交互视频世界模型 Zing-0.5,5B 参数,基于 Wan2.2-TI2V-5B。模型支持键盘操控与自然语言语义改写的联合控制,用户可边移动边用文字实时改写世界,新指令融入当前场景而非重置。单卡 RTX 5090 可超 24 FPS 实时生成,一分钟推理成本约 6 分钱。在 WBench 评测中位列实时世界模型第一。

蚂蚁百灵推出首个金融增强模型 Ling-3.0-flash-Fin

蚂蚁集团推出首个金融增强模型Ling-3.0-flash-Fin,延续 Ling-3.0-flash 模型 124B总参数/5.1B激活参数架构,面向真实金融工作流,重点打磨信息检索、研究推理、估值建模、研报撰写四大核心能力。模型在与中金联合打造的FinFIRST 以及 FinSearchComp Verified 等金融智能体基准上进行测试表现优异。

a16z成立规模 11 亿美元的 Machine Age Fund,押注 AI 硬件

a16z宣布成立11亿美元的 Machine Age Fund,专注投资AI物理基础设施,涵盖芯片、内存、网络、数据中心、机器人及家庭AI设备。基金认为AI正从聊天走向推理与编码,算力需求呈指数级增长,现有供应链和物理极限面临挑战,亟需重构。

OpenAI 宣布终止与 Cursor 的合作关系

OpenAI 宣布终止与 Cursor 合作,Cursor 对其模型的直接访问将于 11 月 12 日结束。OpenAI 称因 Cursor 被 SpaceX 收购,鉴于马斯克旗下公司此前存在违反合同、蒸馏数据等”黑历史”,无法确信其合规使用技术。此外,OpenAI 即将推出的 Astra 模型可能达到关键级网络安全能力,需严控分发渠道。

8月28·周五

腾讯混元推出新一代旗舰模型 Hy4 preview

腾讯混元推出新一代旗舰模型Hy4 preview,总参数770B、激活参数49B,上下文长度达1M。模型在代码、办公、游戏开发及科学研究等真实生产力任务上表现卓越,端到端推理吞吐提升31.8%。模型在科学领域取得重大突破,分子动力学模拟提速2倍,将百年几何难题三维Blaschke-Lebesgue体积下界推进至0.41104。

谷歌推出 AI 视频生成模型 Gemini Omni 1.1 Flash

谷歌推出Gemini Omni 1.1 Flash视频生成模型,最高支持4K分辨率输出。模型支持基于现有视频每次以10秒为步长逐步扩展,单条视频最长可达40秒,用户可指定首尾帧实现平滑转场与运镜。模型支持从360p快速预览到4K超高清的多档位输出,生成速度提升60%且成本仅为三分之一,支持引入最长3秒参考视频维持角色与场景一致性。

AI基础设施公司基元律动完成数千万美元融资

AI基础设施公司基元律动(TokenRhythm)宣布完成数千万美元融资,弘晖基金领投。公司同步启动TokenRhythm API平台公测,对标OpenRouter,提供一站式多模型调用服务,日调用量超5000亿Token。公司核心战略是Routing Harness智能路由基础设施,可根据任务动态选择、切换和协同模型。

8月27·周四

智谱开源原生多模态模型 GLM-5.3-Flash

智谱正式推出 GLM-5.3-Flash,是GLM-5系列首个原生多模态模型,AA综合智能指数57分与Claude Opus 4.8持平,定价仅后者1/40。模型采用稀疏+线性注意力混合架构,激活参数量与层数近乎减半,长上下文成本大幅降低。原生集成视觉编码能力,支持代码、浏览器与GUI协同。

阿里通义推出多模态 MoE 模型 Qwen3.8-Flash

阿里正式推出多模态MoE模型 Qwen3.8-Flash,总参数125B,每token仅激活6B,原生支持26万token上下文并可扩展至100万。模型采用GDN与QSA混合注意力、门控残差、N-gram嵌入及Muon优化器四大升级,训练成本降至前代1/9,编码与办公能力更强。模型对外提供API服务定价输入1元、输出3元每百万token。

腾讯混元推出端侧翻译大模型 Hy-MT2-1.8B

腾讯混元推出Hy-MT2-1.8B翻译模型,通过2-bit和自研Sherry 1.25-bit技术,将3.3GB模型极致压缩,翻译质量几乎无损且优于微软、豆包等商业API。联合英特尔完成x86算子优化,已在哔哩哔哩直播弹幕实时翻译中落地,支持33语种,单条弹幕翻译耗时500-800ms。

阿里千问办公国际版,开启公测

千问办公国际版(QwenWork)开启公测,海外个人及企业用户可通过网页版与PC客户端体验。产品定位All-in-One AI生产力平台,已接入Slack、Notion等海外协作工具,未来将连接企业数据库与工作流。产品现已支持中英文,即将拓展西语、葡语、日语、韩语等;账号体系支持Google账号、邮箱及阿里云国际账号注册。

谷歌推出语音转文本模型 Gemini 3.5 Transcribe

谷歌推出 Gemini 3.5 Transcribe 语音转文本模型,可自动删除”嗯””呃”等口头禅及自我修正内容,生成更通顺文本。相比前代 Chirp 3,速度提升约 70%,实时语音错误率降至 5.5%。模型支持 85 种语言及最多 3 人预录音频,已用于 Pixel 11 的 Gboard 键盘的”Rambler”功能。

8月26·周三

爱诗科技推出实时全模态世界模型 PixVerse R2

爱诗科技推出 PixVerse R2 实时全模态世界模型技术报告。PixVerse R2 在 PixVerse R1 基础上进一步探索实时世界模型的 Scaling 路径,通过 Omni Causal AR 统一架构支持文本、参考图、音频、动作等多模态输入,实现边生成、边交互、边演化的持续世界运行。

Stability AI 完成 7600 万美元 B 轮融资

Stability AI 宣布完成 7600 万美元(约 5.12 亿元人民币)B 轮融资,资金将用于创意产品开发、应用研究及专业服务扩展。投资方包括 EA、索尼音乐、环球音乐、华纳音乐及 AMD 风投部门。CEO Prem Akkaraju 表示,投资者群体将提供资金,带来专业知识、行业信誉及与艺术家的直接联系,助力生成式 AI 赋能创意人士。

即梦 AI 正式推出影视内容厂牌「即梦片场」

即梦AI推出影视厂牌「即梦片场」,8-12月面向影视公司与AI创作者征集电影、剧集项目。电影设S/A两档、剧集设S/A/B三档扶持,提供算力技术与发行全链路支持,联动番茄小说IP。同步推出创作者成长计划,含创作基金及”锋芒回响”奖励,优质作品最高可获10万元现金与百万宣推资源,助力AI影视IP开发。

谷歌推出实时协作 Vibe Coding 工具 Play with Putty

谷歌实验室推出实时协作工具 Play with Putty,主打 “Vibe Coding 体验。用户无需编程基础,通过自然语言描述需求,AI 可自动生成代码并实时渲染为可用工具或网站。工具支持多人可通过链接进入同一共享空间协作,修改即时同步。产品定位轻量消费级实验工具,让软件从个人编写变为集体对话,在实时协作中快速成型。

8月25·周二

字节跳动推出 AI Agent 办公产品「豆包工作」

字节跳动推出全新AI Agent产品「豆包工作」,定位面向生产力场景的办公助手。产品可自主拆解任务、调用工具并推进复杂工作流,支持写文档、做PPT、搭网页、建系统等全栈能力;同时能操作虚拟桌面,全程可见且随时接管。产品与飞书深度打通,可基于企业上下文查会议、总结群聊、生成周报。

小红书开源统一语音生成与编辑模型 FireRedTTS3

小红书FireRed团队开源统一语音生成与编辑模型FireRedTTS3。模型基于RedAE语义增强连续表示与LLM-DiT架构,单一模型可实现24种语言及21种中文方言的零样本音色克隆、自然语言声音设计与指定区域精准语音编辑。模型在四个公开评测集上均取得最优成绩,为有声内容、游戏配音及品牌客服等场景提供高效解决方案。

LiblibAI 推出海外 AI 视频创作平台 Newtake

LiblibAI推出海外AI视频创作平台Newtake,主打影视级内容制作。产品基于无限画布和节点工作流,集成导演控制台、电影感灯光、多视角解析、纹理角色表及专业镜头复刻等功能,已接入Seedance 2.5模型。产品核心优势在于通过角色一致性管理解决AI视频变脸痛点,用可视化节点工作流降低专业影视制作门槛。

8月24·周一

中国电信天翼 AI 推出桌面级通用智能体助手 TeleAgent

中国电信天翼 AI 推出星辰超级智能体桌面版TeleAgent,定位为AI办公搭子,支持Windows 10及MacOS 13以上系统。工具可自动完成文件整理、Excel汇总、数据分析、PPT制作、资料搜集等任务,用户只需语音或文字下达指令可实现你说TA做。

阿里正式上线视频生成模型 Wan3.0

阿里视频生成模型Wan3.0正式上线。模型在生成时长、万能创作、全能参考及真实世界还原等维度全面升级,单次可生成30秒视频,首次支持doc、xls、ppt、pdf、md等文档格式输入。Wan3.0在短剧、影视、广告、文旅、音乐MV等多行业落地应用,用户可在阿里云百炼、万相官网等平台体验。

RunningHub 上线全新一代视频生成模型 Wan3.0

Wan3.0 首发上线 RunningHub,模型单次生成最长 30 秒,支持文本、图片、音频、视频及 doc/ppt/pdf 等文档输入,实现 PPT 一键转视频。人物与场景一致性显著提升,告别”AI 脸”。RunningHub 旗下 rhTV、RHSTORY、ComfyUI 等生态已全面适配,覆盖影视、广告、电商等商用场景。

8月21·周五

阿里通义推出 GUI 智能体基座模型 Qwen-UI-Agent

阿里通义推出 Qwen-UI-Agent GUI智能体基座模型,覆盖手机、电脑、网页及深度搜索场景。模型基于100+台真机、150+应用训练,在MobileWorld、OSWorld、WebArena等多项基准上超越GPT、Claude、Gemini等旗舰模型。模型具备严格安全边界,可拒绝违法请求并在支付、删除等敏感操作前主动确认用户。

OpenAI 开源 AI Agent 底层执行框架 Codex Harness

OpenAI 开源 AI Agent 底层执行框架 Codex Harness。框架负责任务理解、记忆保持、工具调用及人类审批等完整执行循环,支持通过 CLI、SDK 和 app-server 嵌入业务系统。核心特性包括沙箱安全执行、原生 Human-in-the-Loop、流式事件传输及模型无关架构。

商汤科技开源原生统一多模态大模型 SenseNova U1.5 Lite

商汤科技正式开源轻量级原生统一多模态大模型SenseNova U1.5 Lite。模型聚焦真实视觉创作流程,重点强化超长指令遵循原生支持 3-4k 上下文长度、视觉质量、文字与布局、原生4K高分辨率输出、原生图像编辑及精细视觉控制能力。

Ling-3.0 tiny & flash Base Models 正式开源

蚂蚁百灵大模型正式开源 Ling-3.0-tiny-base 与 Ling-3.0-flash-base 两个基础模型,同时同步开放预训练、中期训练及 WSM 合并共 6 个关键训练节点权重。Ling-3.0-tiny-base(总参数 7.9B,激活参数 1.3B)适合代码与低成本后训练研究,Ling-3.0-flash-base(总参数 124B,激活参数 5.1B)兼顾代码、推理与长上下文能

鹿明机器人推出具身智能进化引擎 Lumos NexCore

鹿明机器人在2026世界机器人大会发布具身智能进化引擎Lumos NexCore,定位为产业”技能基础设施”。平台整合数据资产、模型训练、评测验证、技能封装与设备运营,能让机器人能力像云服务一样被调用、训练和迭代。

8月20·周四

DeepSeek Harness更新,增强多模态

DeepSeek Harness 推出 v0.1.0-rc.8 版本,重点增强多模态能力,支持原生图片请求与图文混合输入,可将 Claude Code、Codex 作为子代理按需调用。同时优化工具并发查询与 Windows 终端体验,修复多项稳定性问题,进一步巩固其作为 Agent 统一调度层的定位。

MiniMax 推出 AI Agent 商业内容生产平台 MiniMax Design

MiniMax稀宇科技推出 AI Agent 驱动商业内容生产平台 MiniMax Design,基于 MiniMax H3 原生多模态视频模型构建。用户只需表达创作意图,Agent 可自动拆解任务、调用模型与工具,完成从素材处理、生成编辑到成片交付的全流程。平台提供 3D 导演台预演构图、自动剪辑字幕、ComfyUI 工作流接入等功能。

8月19·周三

智谱 GLM-5.3 API 即日起正式上线

智谱GLM-5.3 API正式上线,擅长复杂编码、网络安全及长程任务。在AA综合智能指数中获60分,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰同档,与Kimi K3并列开源模型第一。GLM-5.3以更小的参数规模和最低的单任务成本达到前沿水平,定价与上一代持平,模型权重将于下周五开源。目前已接入ZCode等编码平台,并开放API调用。

微软开源 4B 参数多模态模型家族 Mage

微软开源4B参数多模态模型家族Mage,包含流式视频/图像理解模型 Mage-VL 与图像生成与编辑模型 Mage-Flow。Mage-VL采用Codec-Native编码,视觉Token减少75%,视频推理提速3.5倍,支持实时流式理解。Mage-Flow支持512-2048任意原生分辨率文生图与指令编辑,Turbo版仅需4步采样,A100单卡0.6秒出图。

字节跳动推出扣子桌面端

扣子桌面端正式上线,让 Agent 从网页走进本地电脑。用户授权后,Agent 可直接读写本地文件、执行命令、管理项目,自动将结果存回指定位置。同时推出扣子云盘,实现本地与云端文件随时接力,支持多 Agent 共享协作。手机 App 可远程遥控桌面端 Agent 处理电脑文件。

8月18·周二

Cursor 推出 AI 原生代码托管平台

Cursor推出AI原生代码托管平台Origin,即日起向所有付费用户逐步开放Beta版。平台提供代码仓库、PR审查、代码浏览及GitHub双向同步等核心功能,支持与GitHub仓库并存运行。平台已集成Vercel、Depot、Buildkite等第三方应用,每个仓库内置AI智能体可直接修改代码、更新PR。

智象未来推出交互式世界模型 HiDream-O1-World

智象未来推出原生全模态交互式世界模型HiDream-O1-World,支持文本、图像及交互多模态输入,具备漫游、编辑、交互三大功能。模型搭载自研UiT架构,在时空一致性与物理一致性上实现关键突破,首次参评即登顶WBench交互式世界模型评测Navi分榜。应用场景涵盖AI互动影游、具身智能仿真及3D场景生产等领域。

昆仑万维推出 AI 音乐生成模型 Mureka V9.5

昆仑万维推出AI音乐生成模型 Mureka V9.5,基于 MusiCoT框架,V9.5 在编配留白、人声真实感与意图精准度上大幅跃升,人声良品率达 61.0%,控制良品率达 97.0%。模型在中文国风领域实现突破,咬字更准、和声更克制、编曲更具神韵。Mureka V9.5基于超 2.5 万份 用户反馈迭代,能让AI音乐从能生成走向值得单曲循环。

阿里千问办公开源上下文基础设施项目 MyContext

阿里千问办公开源上下文基础设施项目 MyContext。项目以本地化方式运行,将钉钉、飞书等IM沟通、文档、会议等多源工作数据自动沉淀为Agent可理解的专属工作档案,信息可溯源。针对信息冲突采用语义分析或用户确认机制,确保准确性。用户可据此构建专属Agent助手,自动回复工作信息。

AI视频生成独角兽 Higgsfield 完成4亿美元融资

AI视频独角兽Higgsfield完成4亿美元融资,投后估值54亿美元(约366亿元),投资方包括DST Global、高盛、Liberty Global和英特尔。公司年化营收达7亿美元,一年内增长约34倍,估值8个月涨315%。平台拥有超3000万用户,覆盖238个国家和地区。

8月17·周一

Stripe以超过70亿美元价格收购 OpenRouter

支付巨头Stripe已敲定收购AI基础设施初创公司OpenRouter,交易金额超70亿美元(约473亿元人民币)。OpenRouter为用户提供统一入口,可在超400种AI模型间按需选择,全球用户达800万。公司今年5月B轮融资估值约13亿美元,此次收购价为其5倍以上,将成为近年AI基础设施领域重大收购案之一。

阿里巴巴推出 AI 音乐模型 HappyShrimp

阿里巴巴推出AI音乐模型HappyShrimp(快乐虾米),支持端到端整曲生成,实现作词、作曲、编曲、演唱一体成型。模型深度理解自然语言,用户仅需描述情绪或故事即可创作,大幅降低音乐创作门槛,同时解决AI音乐人声机械、词曲错位等痛点。

Qwen-Audio-3.0系列语音模型正式上线千问AI平台

阿里巴巴Qwen-Audio-3.0系列语音模型正式上线千问AI平台,开发者可通过API或Token Plan调用。Qwen-Audio-3.0系列包括语音识别大模型Qwen-Audio-3.0-ASR、语音合成大模型Qwen-Audio-3.0-TTS、实时语音交互对话模型Qwen-Audio-3.0-Realtime。目前已在千问App、千问办公等产品中落地应用。

SpaceXAI以600亿美元正式完成收购 Cursor

SpaceX以600亿美元正式收购,团队将加入SpaceXAI共同开发Grok系列及Cursor产品。这是史上最大规模的创业公司收购案。Cursor将借助SpaceX全球最大GPU集群获得更强算力,同时xAI发布全新AI队友产品Grok Bot,可24/7自主运行多步骤真实任务。

8月14·周五

谷歌推出最新主力模型 Gemini 3.7 Flash

谷歌推出Gemini 3.7 Flash模型,专为编程与Agents场景设计。模型在软件工程、知识工作及网页开发等方面大幅提升。即日起至2026年底,首发优惠价仅为3.6 Flash原价的一半:输入每百万Token 0.75美元,输出3.75美元。Gemini Spark已接入该模型,优化Workspace工具使用能力。

智谱推出最新 AI 大模型 GLM-5.3

智谱推出GLM-5.3,基座未变但通过后训练Scaling大幅提升智能上界,成为当前编程能力最强的开源模型,在Terminal Bench 3.0等多项基准测试中取得开源第一。模型同时涌现出强大的网络安全能力,在代码审查与漏洞发现等任务中表现突出。智谱联合多家安全团队累计发现2436个漏洞,并启动”开源的盾”计划。

MiniMax 开源音乐模型 MiniMax-Music3

MiniMax 开源音乐模型 MiniMax-Music3,支持歌词生成最长 5 分钟歌曲。模型采用分层架构:8B 全局模型负责长程语义与结构,0.6B 局部模型恢复细粒度声学信息。MiniMax-Music3输出 32kHz 立体声 WAV,可保持主题、节奏、歌声身份及编曲推进,覆盖前奏、主歌、副歌等结构。

小红书开源多模态 MoE 模型 dots3-note preview

小红书 dots 模型实验室开源 dots3-note preview,为 dots3 系列首个开源版本。模型总参数 280B、激活参数 16B,支持 512K 超长上下文,具备文本、视觉与语音多模态理解能力,针对复杂推理、Agent 和多模态感知优化。模型在多项 benchmark 上可比肩参数数倍的大模型。

8月13·周四

DeepSeek-V4-Pro 正式版上线

DeepSeek 推出 DeepSeek V4 Pro 正式版,已同步在APP、网页端和API上线。该版本Agent能力显著增强,在Terminal Bench、DeepSWE等评测集上表现优异。API新增原生支持OpenAI Responses API格式,适配Codex;思考模式新增low/high/max三档可选。

DeepSeek Harness 开发者预览版开放测试

DeepSeek Harness开发者预览版(v0.1 版本)面向全球 Harness 开发者开放测试,并同步以MIT协议开源。产品采用”一切皆插件”架构,基于Cordis插件系统构建,模型、工具、技能等Agent能力均可自由替换组合。提供标准、PTC、极简、创造四种运行模式,支持完整工具调用与自定义预设。

SpaceXAI 推出 AI Agent 系统 Grok Bot

SpaceXAI 推出 AI Agent 产品 Grok Bot,可登录用户账号在云端独立运行,24 小时不间断执行任务。每个 Bot 拥有专属云计算机,支持多 Bot 并行协作、Bot 间通信,可自主创建新 Bot。Grok Bot 产品原型为 xAI 收购 Cursor 前其内部代号「Sand」的 Agent 项目。

SpaceXAI 推出最新一代旗舰大模型 Grok 4.6

SpaceXAI正式推出Grok 4.6模型,进一步强化长时间智能体任务、复杂交互及视觉工作能力,可处理资料研究、代码库分析等复杂任务。在AA Intelligence Index综合基准测试中,Grok 4.6与GPT-5.6 Sol取得相同成绩。

小红书开源语音合成基座模型 dots.tts

小红书 dots 团队与上海交通大学 X-LANCE 实验室联合开源 dots.tts,一款 20 亿参数、全连续隐空间自回归 TTS 基座模型。模型不依赖离散声学 Token,在零样本声音克隆评测 Seed-TTS-Eval 上达到 SOTA,支持音色微调与语音编辑。

记忆功能上线,让 Meoo 越用越懂你

秒悟Meoo 上线记忆功能,支持自动整理并保存用户的个人背景、工作习惯、回应风格及项目规则等长期有效信息,在后续对话中智能调用。记忆分为仅本人可见的”个性化记忆”,含用户画像、工作手册、回应风格、记忆碎片和团队共享的应用记忆两类。

LTX 开源 AI 视频生成基础模型 LTX-2.5

开放世界模型公司 LTX 发布 LTX-2.5,原生集成 ComfyUI。在 2 张英伟达 GB200 上,生成 10 秒 720P 视频仅需 6.8 秒,API 版 23.7 秒输出 1080P。新模型具备更高像素保真度、多镜头连贯性及扩散保真渲染技术。用户可通过 Hugging Face、ComfyUI 及 API 调用。

Qwen 团队开源 Qwen3.8-2.4T-A95B 模型权重

Qwen团队开源Qwen3.8-2.4T-A95B模型,为Qwen-Max级别首次开放权重。该MoE模型总参数2.4T、每Token激活95B,原生支持256K上下文,重点提升编程、办公、科研及长周期Agent能力。在PaperBench、TerminalBench等多项评测中表现领先,支持SGLang、vLLM等框架部署,默认思考模式且支持推理深度调节。

8月12·周三

Manus 恢复独立公司运营

Manus宣布脱离Meta恢复独立运营。Manus去年12月被 Meta 用超20亿美元收购,因跨境监管审查,双方重新调整架构。Manus要求部分用户在8月23日前备份数据,8月25日恢复服务,受影响的用户过渡期间不被收取任何费用并提供回归奖励。

Bilibili 开源工业级零样本语音克隆模型 IndexTTS-2.5

Bilibili 开源工业级零样本语音克隆模型 IndexTTS-2.5,参数量仅 0.8B,支持中、英、日、西、阿五种语言跨语种迁移。模型重构了推理架构,速度提升 2.28 倍,实时率低至 0.20,同时支持 0.5x 至 2.0x 无级语速调节,提供拼音、CMU 音素和日语假名三种粒度的发音干预。

豆包推出学生特惠活动

豆包推出学生特惠活动,面向在校大学生提供2.5倍免费额度及专业版特惠价,辅助科研、创作等复杂学习任务。用户可通过豆包电脑端发送”我要领取学生优惠”完成认证,或在设置界面通过抖音账号认证获取权益。

微软推出编程模型 MAI-Code-1.1-Flash

微软推出升级版编程模型 MAI-Code-1.1-Flash,代码能力显著提升:模型在 Terminal-Bench 2.1 测试中的表现提升 22%,.NET 任务提升 15%,并新增原生视觉能力。新模型 Token 生成速度提升 25%、消耗减少 25%,价格降至初代四分之一。目前已陆续登陆 VS Code、JetBrains 等 Copilot 平台,旧版将于 2026 年 9 月 10 日

8月11·周二

OpenAI 推出 AI 网络安全模型 GPT-5.6-Cyber

OpenAI扩展网络安全防御服务Daybreak,新增Blue与Red两个等级。Blue提供事件响应、恶意软件分析等常规服务;Red包含专为安全测试和漏洞研究训练的新模型GPT-5.6-Cyber。GPT-5.6-Cyber 模型目前仅向埃森哲、IBM、CrowdStrike等可信合作伙伴开放。

Meta 开源 300 亿参数大语言模型 Muse Glimmer

Meta 开源300亿参数模型Muse Glimmer。模型专为本地常驻运行设计,通过4-bit量化和DFlash投机解码技术,可在24GB显存设备,如Mac、消费级GPU上流畅运行,支持断网操作、多模态感知、工具调用及代码编写。

ZCode全面升级,GLM Coding Plan全员额度回满

智谱AI旗下 ZCode 全面升级,上线 Goal、Subagents、Remote Control、闲时任务 四大功能。Goal模式支持设定可验收目标后自主拆解、执行并迭代交付复杂任务;Subagents实现多智能体并行协作;Remote Control支持手机/微信远程管控;闲时任务可在低峰时段免积分执行。同时,GLM Coding Plan 额度已统一重置,全员额度全部回满。

腾讯推出 Windows 端桌面美化工具「小鹅桌面」

腾讯推出Windows端桌面美化工具「小鹅桌面」,以免费无广告为核心卖点切入市场,提供百万级4K超清动态与静态壁纸资源。产品在桌面左上角内置轻量化AI对话窗口,可完成待办备忘与文件搜索。工具面向学生及普通个人用户,与办公向产品WorkBuddy形成错位布局,通过壁纸美化卡位Windows高频桌面场景。

8月10·周一

阿里推出一站式 AI 语音平台 CosyVoice Studio

阿里巴巴推出国内首个一站式AI语音平台CosyVoice Studio,基于自研 Qwen-Audio 模型,集成语音记录 CosyFlow 、语音智能体 CosyAgent 和音频创作 CosyCreative 三大模块。CosyFlow支持语音转写叠加语义理解并生成结构化文本,CosyAgent可通过自然语言快速创建实时语音交互智能体,CosyCreative支持上传文档生成播客与多角色有声书

英伟达开源自动驾驶 AI 推理模型 Alpamayo 2 Super

NVIDIA推出Alpamayo 2 Super智能汽车开放模型,基于Cosmos 3 Super Reasoner构建并采用OpenMDW 1.1商业许可,支持商用与微调。模型在LingoQA等辅助驾驶基准测试中排名第一,可输出轨迹规划、因果推理、元动作、自动标注及视觉问答五类结果,决策过程透明可验证。

Cloudflare 推出 AI Agent 云端轻量浏览器 Kitesurf

Cloudflare 推出 Kitesurf,专为 AI 智能体打造的云端浏览器,基于 Workers 平台运行,支持浏览网页与填写表单,较 Chromium 更省计算资源显著降低运行成本,同时针对 AI 特性优化上下文窗口与性能表现,防范提示词注入攻击,目前 Kitesurf 处于测试阶段,正式版将在未来推出。

腾讯混元团队推出 3D 世界生成框架 WorldClaw

腾讯混元3D研究团队推出 WorldClaw,基于 Agent 的 3D 开放世界生成框架。框架能将一句开放式文本提示转化为可探索、可编辑的完整 3D 世界,在保持全局地形连贯性的同时,按需为局部区域生成丰富细节。WorldClaw 将地形与每个对象作为独立可编辑实例输出,支持自由视角漫游、对象级编辑及游戏引擎直接接入。

8月7·周五

阿里推出全新一代视频生成模型 Wan3.0

阿里全新一代视频生成模型Wan3.0开启公测。模型单次可生成30秒视频,支持连续运镜与一镜到底叙事;在文本、图片、音频、视频四种基础模态之外,首次支持doc、xls、ppt、pdf、md等文档输入,可将办公素材直接转化为教学课件、产品演示等视频。人像追求千人千面,角色、道具、场景、风格一致性显著增强。

OpenAI 开放免费用户与 ChatGPT 文字畅聊

OpenAI宣布免费用户与ChatGPT的文字聊天不再受限,默认模型升级为GPT-5.6 Luna,性能优于GPT-5.5 Instant。免费及Go订阅用户还可使用新增思考按钮处理复杂问题,但文件上传、图片生成、语音对话等高算力功能仍受限。付费用户将获得更可靠、简洁的GPT-5.6 Sol及5档思考强度滑块。

阿里全新一代视频生成模型 Wan3.0 上线「堆友」

阿里全新一代视频生成模型Wan3.0正式开启公测,同步上线堆友Agent及视频生成模块。模型支持单段30秒视频生成,具备智能时长推荐与视频延长功能;支持文本、图片、视频多模态参考,实现万物皆可生视频;人像刻画千人千面,在角色、道具、声音等维度保持高一致性,视频编辑能力也大幅提升。

火山引擎上线 Seedance 2.5 API 服务

火山引擎正式上线Seedance 2.5 API,相比2.0在指令遵循、长叙事、真人感及声画质感上大幅提升,原生支持30秒视频直出与最高50个全模态素材参考,兼容十余种语言。模型已在LibTV、奇想AI、TapNow等平台同步上线。

蚂蚁百灵推出原生混合推理模型 Ling-3.0-tiny

蚂蚁百灵正式推出Ling-3.0-tiny原生混合推理模型,总参数7.9B、每token仅激活1.3B,面向数学推理与端侧部署深度优化。模型原生支持工具调用,可直接驱动浏览器UI与移动设备自动化操作,支持完全本地离线推理。

8月6·周四

兔展智能推出一站式 AI 设计生产工具 RabbitVis

兔展智能推出图层级一站式AI设计工具RabbitVis,基于自研 UniWorld-Design 视觉大模型,将AI生成与图层级编辑深度融合。产品突破传统AI生图只能生成、难以修改的瓶颈,支持透明素材生成、图像分层拆解与持续编辑,让海报、电商图、杂志内页等设计资产可反复调整与复用。

Meta 推出终端编程 AI 智能体 Muse Code

Meta 推出首个编程 AI 智能体工具 Muse Code 测试版,由首席 AI 官汪滔领衔开发。模型基于 Muse Spark 1.2 模型,可处理大型代码库中的完整软件工程任务,直接挑战 Anthropic Claude Code 与 OpenAI Codex。

阿里云上线One Key MCP,一键调用多家MCP服务

阿里云上线One Key MCP服务,开发者可通过统一的阿里云百炼API Key一键调用所有生态伙伴MCP服务,兼容Qoder、Codex、Claude Code、Cursor等主流Coding Agent,大幅简化多MCP服务的接入、鉴权与计费管理流程。用户可登录阿里云百炼平台,在MCP广场直接使用现有API Key开通并调用相关服务。

腾讯推出 AI 原生数据分析平台 Omega

腾讯推出AI原生数据分析产品Omega,内测版名为「马尔摩斯(marmos)」,用户通过自然语言可生成完整数据仪表盘,支持持续交互修改、筛选联动与数据动态刷新。产品采用QueryRegistry数据契约与DTBridge运行时架构,叠加多层权限校验与AST只读检查,解决传统AI看板数据凝固与安全问题。

8月5·周三

阿里推出原生 Computer Use Agent「Qwen-CUA」

阿里 Qwen 团队联合 XLang Lab 推出原生 Computer Use Agent「Qwen-CUA」,基于 397B-A17B 混合专家架构,通过屏幕截图感知界面状态,无需依赖 DOM 树或无障碍元数据,直接输出键盘鼠标事件操控浏览器、桌面及专业软件。模型在 OSWorld-Verified 基准取得 86.2 分,万亿参数 Max 版本达 87.6 分。

腾讯混元推出新一代语音识别模型 Hy ASR 3.0 preview

腾讯混元推出新一代语音识别模型Hy ASR 3.0 preview,模型基于Hy3大语言模型打造,深度融合语音识别与深度语义理解能力,在中文普通话、英语及粤语等场景的识别准确率均达到业界顶尖水平,具备复杂语境下的智能纠错能力。

阿里千问图像生成模型 Qwen-Image-3.0 上线千问AI平台

阿里巴巴千问图像生成模型Qwen-Image-3.0上线千问AI平台,面向所有用户免费开放。旗舰版Qwen-Image-3.0-Pro与标准版Qwen-Image-3.0-Standard同步开放API。在国际评测平台Arena.ai最新文生图榜单中,模型位列国内第一、全球第五。

字节跳动推出音视频全双工大模型 SeedRealtime

字节跳动 Seed 推出原生音视频全双工大模型 SeedRealtime,基于统一架构原生融合音频、视频与文本,实现”边看、边听、边说”的实时多模态交互。模型具备音视频联合理解、主动交互与流畅对话节奏三大核心能力,端到端评测显示对话节奏问题较级联模型减少一半。

Mistral AI 开源多模态内容审核模型 Shieldstral

Mistral AI 开源多模态内容审核模型 Shieldstral,支持 12 种语言且单张 16GB GPU 可运行。模型在多模态审核领域达到 SOTA,性能媲美 7 倍规模竞品;创新性地将审核策略用自然语言问题形式输入,通过”是/否”问答机制输出校准安全分数,支持提示词分类、回答审核与毒性检测等任务。

京东开源实时流式视频编辑模型 JoyAI-Video-Edit

京东开源自研实时流式视频编辑模型 JoyAI-Video-Edit,支持视频边播边改,在 720P 分辨率下实现每秒 30 帧推理,可处理任意时长视频。模型在 OpenVE-Bench 评测中全面领先 SANA Streaming、LiveEdit 等同类流式模型,编辑质量达到离线模型水平。

8月4·周二

腾讯混元推出智能体评测基准 E-Bench

腾讯混元联合清华AIR、东南大学推出 E-Bench 智能体评测基准,以王者荣耀、QQ音乐、腾讯会议为原型,构建含323个改状态任务、7.6万+数据行的全合成虚拟环境。通过信息鸿沟与工具鸿沟设计,防止模型凭记忆抄近道。E-Bench 评测了11个前沿模型平均成功率仅54.56%,最强模型Avg@3为73.79%,Pass³低于60%。

商汤科技与教育部教育技术与资源发展中心达成战略合作

商汤科技与教育部教育技术与资源发展中心(中央电化教育馆)签署战略合作框架协议,双方将推动AI技术在教育公共服务领域应用,促进教育技术与教学资源深度融合,赋能国家级教育服务平台智能化建设。商汤依托日日新SenseNova大模型体系与SenseCore算力基础设施,已为高校教学科研、K12教案生成等场景提供支撑。

商汤科技开源原生统一多模态模型 SenseNova U1.5-Lite-Preview

商汤科技开源轻量级原生统一多模态模型SenseNova U1.5-Lite-Preview,基于NEO-Unify架构,用仅8B-MoT参数贯通视觉理解、推理、生成与编辑。模型原生支持4K图像生成,在局部纹理、真实质感、中英文文字排版及复杂视觉指令遵循上显著提升,配套Prompt Enhance Skill降低长篇创作指令的编写门槛。

面壁智能开源 Stencil 全自动研究部署系统 ForgeStencil

面壁智能联合 OpenBMB 开源 ForgeStencil,全球首个 AI 驱动的 Stencil 全自动优化系统。ForgeStencil由 Kernel Agent 与 App Agent 双智能体协同,实现从算子研究到应用部署的全流程零人工介入。ForgeStencil 一周能完成 100 余个真实工业与科学软件的端到端优化,覆盖油气勘探、电磁仿真、医学影像等 8 大工业领域。

帕西尼再获10亿元战略轮融资

帕西尼再获10亿元战略轮融资,累计融资35亿元,创全球触觉感知领域最高纪录。本轮由全球消费电子与半导体万亿级巨头、中银国际投资、鲲鹏基金等联合领投,老股东持续加码。帕西尼以全栈自研具身感知技术为核心,定位Physical AI时代物理交互数据基础设施,年芯片消耗量逼近100万颗,商业化与全球化布局加速推进。

8月3·周一

阿里推出多角色 Agent 协作工作台「万有无界」

阿里云内测面向B端的AI办公平台万有无界,平台由多名数字员工组成协作小组,围绕完整项目协同推进任务。万有无界聚焦复杂项目的多智能体协同交付,进一步完善阿里AI办公产品矩阵。实测发现,自由职业者和个体创业者同样能找到适配场景,平台轻量化适配性突出。

阿里推出新一代旗舰大模型 Qwen3.8-Max

阿里云正式推出Qwen3.8-Max,参数规模达2.4万亿、激活参数95B,支持100万上下文Tokens,在编程、办公、科研及长程任务上全面升级,下周将开源模型权重。模型在Arena文本、代码、视觉三大榜单均位列前三,API定价国内输入12元/百万Tokens。

MiniMax开源新一代通用视频模型 MiniMax H3

MiniMax正式开源新一代通用视频模型 MiniMax H3,支持文本、图像、视频、音频多模态输入,可生成最高2K分辨率、15秒时长、32kHz立体声音频的视频。模型由H3-Context-IR、H3-Base和H3-Regenerate-2K三模块组成,H3-Base已开源并支持SGLang、vLLM等框架本地部署。

Genspark 推出本地 AI Office 客户端 GenOffice

Genspark 创始人景鲲在 AGI Playground 2026 大会上推出 GenOffice,定位为全球首个全功能开源 AI Office 套件。GenOffice客户端面向 Windows 与 Mac,支持文档、表格、幻灯片及 PDF 编辑,免费、无广告且开源。

大模型公司西湖心辰完成B+轮数亿元融资

扩散语言模型厂商西湖心辰近日完成B+轮融资,金额达数亿元,由广发信德领投,西湖创新投、武汉江豚基金等多家机构跟投,58产业基金等产业资本及老股东蚂蚁集团、汤姆猫参与支持。本轮资金将主要用于新一代扩散语言模型研发、原生多模态实时互动产品迭代及海外市场拓展。

7月31·周五

字节跳动 Seedance 2.5 正式发布,一镜成片,随心参考

字节跳动Seed团队推出新一代视频创作模型 Seedance 2.5,单次生成时长从15秒提升至30秒并支持多轮延长,可产出数分钟连贯内容。模型全面升级多模态参考能力,单次最多支持30张图片、10段视频及10段音频作为参考素材,同时新增时间戳精准编辑、绿幕替换、视角调整等专业功能,满足影视与广告创作需求。

智谱 GLM Coding Plan 开放订阅

智谱GLM Coding Plan重新开放订阅。之前因需求爆发曾限名额,本次回归伴随基础设施扩容,新版采用透明积分制,输入输出及MCP能力均按规则折算,支持周末全天低峰抵扣。老用户权益保留,v1用户到期前可按V2价格续订,同时开放HighSpeed高速版申请。

稀宇科技推出通用全模态生成模型 MiniMax H3

MiniMax推出通用全模态生成模型MiniMax H3,支持文本、图像、视频与声音的统一理解与生成,可输出15秒2K分辨率原生双声道音视频。模型打破任务与模态边界,在指令遵循、动作迁移及多模态编辑方面表现出色,适用广告、电商、游戏等商业场景。

DeepSeek-V4-Flash 正式版 API 上线公测

DeepSeek通过 API 文档发布日志,宣布DeepSeek-V4-Flash正式版API上线公测。Agent能力大幅增强,多项基准测试得分远超V4-Pro-Preview版本。正式版原生支持Responses API格式,针对Codex进行优化适配。模型结构与Preview版保持一致,仅重新进行后训练。

腾讯 WorkBuddy 联合腾讯文档推出人机双写功能

腾讯 WorkBuddy (V5.3.5版)联合腾讯文档推出人机双写功能,让用户与 AI 可在同一份文档中实时协同编辑。工具支持框选即改,AI 仅在指定范围内处理内容,兼容 Word、Excel、PPT、Markdown 等主流格式及本地 Office 与腾讯文档,同时支持多人与 AI 共同创作、实时同步。

LibTV x MiniMax 联合首发通用全模态生成模型 MiniMax H3

LibTV与MiniMax联合首发新一代多模态视频模型MiniMax H3,支持5—15秒视频生成、24 FPS输出与原生双声道声音,可统一理解图文音视频,实现从素材参考到成片编辑的一体化创作,面向短剧、广告、影视等商业场景。

李飞飞 World Labs 收购机器人仿真公司 SceniX

李飞飞旗下World Labs收购SceniX,标志着物理AI训练从采集真实数据转向生成虚拟世界。SceniX通过将真实场景重建为可交互的物理孪生资产,围绕几何、材质、布局等属性生成可控变化,将有限真实数据扩展成无限泛化的世界。

7月30·周四

月之暗面 Kimi 将完成35亿美元新轮融资

月之暗面Kimi完成新一轮融资,筹集35亿美元,估值达350亿美元,并正寻求投前估值约500亿美元的新融资。Kimi在Hugging Face开源K3模型权重,总参数2.8万亿、激活参数1040亿,为全球首个3万亿参数级开源模型。K3基于MoE架构,多家平台已宣布适配,与Claude Sonnet 5标准价持平。

谷歌 DeepMind 推出 AI 音乐生成模型 Lyria 3.5

Google DeepMind 在 Flow Music 推出新一代 AI 音乐生成模型 Lyria 3.5,实现音乐性、歌词质量、人声表现力与创作控制四项核心升级。模型可生成更自然复杂的旋律,歌词遵循度显著提升,人声情感丰富且发音清晰,支持便捷调节节奏与时长。

字节跳动启动AI业务组织调整,飞书将并入豆包

字节跳动启动AI业务组织调整,飞书产品团队并入豆包,由豆包负责人赵祺统筹,飞书负责人谢欣向其汇报。飞书GTM团队与火山引擎整合为创造力服务平台,由谭待负责,统一推进MaaS和SaaS市场。数据显示豆包月活3.82亿,字节大模型ARR已达40亿美元。

腾讯混元团队开源投机解码框架 AngelSpec

腾讯混元团队开源投机解码框架 AngelSpec,覆盖 drafter 训练、架构设计到线上部署全链路,同步开源 Hy3-A21B 的 MTP 与 DFly drafter 权重及训练代码。DFly 在 4 至 64 并发取得 SOTA,较自回归基线平均加速 1.98–2.40 倍,代码数学峰值 2.86 倍;D-cut 高并发额外提升吞吐 15.7%,MTP 结合 TTT 将对话接受率从 52.

7月29·周三

马斯克旗下 SpaceXAI 为 Grok 推出 Build 模式

SpaceXAI 为 Grok 推出 Build 模式,用户输入提示词可将创意实时转化为带独立域名的可发布产品。Build 模式支持生成网站、应用、游戏及实时仪表盘,提供实时预览与自然语言迭代,无需编写代码可调整布局、样式与逻辑。完成后的项目可通过 grok.me 域名或自定义域名发布,支持导出源代码至 GitHub 继续开发。

心言集团推出跨智能体工作流终端 AgentLink

心言集团推出跨智能体终端AgentLink,将Claude、Codex、OpenClaw等分散设备的AI智能体统一接入移动端,扫码可远程操控与协同接力。产品实时展示智能体思考流程与进度,关键节点支持人工确认,独创云笔记接力实现多Agent闭环协作。AgentLink支持双平台,为移动场景下智能体统一管理提供新方案。

360旗下纳米团队推出 AI 办公智能体「纳米Work」

360旗下纳米团队推出新一代企业智能体工作平台纳米Work,平台覆盖谋、干、盯、开发、赚钱、成长六大工作场景,通过多智能体协同执行,交付可直接使用的方案、PPT、网站等成品。平台具备多智能体引擎、多模型底座、云端办公室、多工作模式及多AI专家五大技术亮点,支持一句话布置任务、7×24小时云端执行。

华为开源 AI Agent 统一工作平台 JiuwenSwarm

华为2012实验室、华为云、终端小艺等团队推出首个鸿蒙PC开源AI统一工作台JiuwenSwarm。平台支持办公、编程、娱乐等多场景,一句话可唤醒多智能体团队协同完成任务,如20分钟生成200页PPT、自主开发鸿蒙应用等。同时发布人机协同新范式HITS,实现人与Agent共同组队协作。

商汤科技推出 Seko3.0,首创 AI 视频梦工厂

商汤科技推出Seko 3.0,新版本从创作工具跃迁为创作者成长平台,首创AI视频梦工厂,以Agent智能工作流串联无限画布资产沉淀与Skill生态,将头部创作者经验封装为可调用的专业能力,实现体系化影视级生产。

7月28·周二

Kimi K3 开放模型权重、技术报告和关键 Infra 技术

月之暗面正式推出Kimi K3模型权重、技术报告及三项关键Infra技术。Kimi K3为2.8万亿参数MoE模型,具备原生视觉理解与100万token长上下文能力,规模化效率较前代提升2.5倍。同步开源MoonEP高性能通信库、FlashKDA算子及AgentEnv沙箱系统,覆盖从训练通信到分布式RL环境的关键链路。

蚂蚁集团等开源多智能体搜索协作框架 SearchOS

人大与蚂蚁联合推出开源多智能体搜索框架 SearchOS,能为长程复杂信息检索提供系统级协作基础设施。框架将搜索过程中的任务进度、证据关系与补全状态抽象为跨 Agent 共享的系统状态,使多个智能体能在统一调度下分工协作、避免重复与失忆。

微软推出首个网络安全 AI 模型 MAI-Cyber-1-Flash

微软 CEO 纳德拉官宣首个 AI 网络安全模型 MAI-Cyber-1-Flash,在 CyberGym 基准测试中以 95.95% 的成功率超越Claude Mythos 5 和 GPT-5.5 Cyber 等竞品。模型现已接入多智能体安全系统 MDASH,可高效处理约 90% 网络安全任务,与 GPT-5.4 组合后成本较现有配置降低近 50%。

Midjourney 推出最新 AI 图像生成模型 Midjourney V8.2

Midjourney推出Midjourney V8.2图像生成模型,全面升级提示词理解、风格参考逻辑与出图稳定性,风格种子一致性、垫图融合自然度及复杂场景解析力显著增强,文字渲染精准度与东方古典意境表现达到新高度,一次出图成功率大幅提升。

7月27·周一

Anthropic 推出新一代旗舰级模型 Claude Opus 5

Anthropic推出新一代模型Claude Opus 5,智能水平接近Fable 5,价格仅为其一半。模型在Frontier-Bench、GDPval-AA等编程与知识工作评测中刷新行业纪录。Claude Opus 5在编程、商业自动化、计算机操作等场景表现亮眼,同等成本下性能领先竞品,已成为Claude Max默认模型及Pro版最强选择。

吴恩达开源个人桌面Agent「OpenWorker」

AI教育大佬吴恩达开源桌面Agent项目OpenWorker。与普通聊天机器人不同,工具强调直接交付完成的工作成果,可自主调用本地文件和日常办公工具链完成任务。项目主打本地优先与隐私保护,数据默认保留在用户设备上,用户可自由切换底层模型。OpenWorker目前已支持macOS,Windows测试版已开放下载。

美团推出全场景 AI Agent 平台 CatPaw

美团正式推出全场景AI Agent平台CatPaw,提供开箱即用的AI智能工作台与企业级Agent开发托管能力。平台深度融合美团本地生活行业认知,支持移动端App、PC客户端及云端7×24小时不间断运行,已在内部覆盖9万员工、搭建3万个Agent。CatPaw具备多Agent自主协同、专家与技能即装即用、跨会话长期记忆等能力。

阿里推出一站式 AI 办公工具「千问办公」

阿里正式推出一站式 AI 办公工具千问办公,开放Windows与macOS Beta版下载,主打企业IM写作、Office一站式生成、多模态理解、全栈网页生成等六大核心能力。同时,其鸿蒙电脑Beta版也上架AppGallery应用尝鲜,千问办公应用由钉钉科技开发,支持AI写作、PPT生成、文档互转及多模型切换等功能。

AI互动娱乐平台海艺宣布完成超亿元B轮融资

全球化AI互动娱乐平台海艺宣布完成超亿元B轮融资,由视觉中国、华盖创赢、祥峰投资联合领投。海艺注册用户超6500万,海外占比超90%,毛利率超40%,已沉淀超200万个AI原生创作资产,构建起”SeaArt角色创作+MoreShort短剧消费+SeaSoul角色互动”的完整AI IP生态,从工具竞争转向内容资产与创作者生态壁垒。

美国金融科技公司 Stripe 洽谈收购大模型中转站 OpenRouter

据《华尔街日报》报道,美国金融科技公司Stripe正洽谈收购大模型聚合平台OpenRouter,估值约100亿美元。OpenRouter作为模型路由平台,已接入400余个模型,能帮助企业灵活调用、切换不同厂商AI服务,避免被单一巨头绑定。

7月24·周五

Black Forest Labs 推出多模态基础模型 FLUX 3

Black Forest Labs推出多模态基础模型FLUX 3,首次在统一架构下联合学习图像、视频与音频。模型基于Self-Flow技术,可单次生成最长20秒带原生音频视频,支持文生视频、图生视频等模式。通过模态间物理约束学习世界表征,在机器人操控任务表现优异。

TRAE Work 升级内置 Seedream 及 Seedance 模型能力

TRAE Work 升级内置 Seedream 5.0 与 Seedance 模型,并面向用户免费开放。在 TRAE Work 无需切换工具,通过自然语言可在工作流中直接生成图片和视频,支持文生视频、图生视频及文生图,同时提供多种时长、比例与分辨率。生成内容可嵌入任务上下文,无缝衔接后续文档撰写等工作。

微软推出两款 AI 模型 MAI-Image-2.5-Pro 与 MAI-Voice-2-Flash

微软正式推出两款自研AI模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash并开启公开预览,两者均基于内部训练流程构建。MAI-Image-2.5-Pro是微软目前精度最高的图像模型,支持主视觉生成、细节编辑及图像内文字渲染。MAI-Voice-2-Flash针对高并发语音场景优化,支持15种语言。

小红书开源多模态大模型流水并行训练框架 BigMac

小红书 dots infra 团队开源多模态大模型训练框架 BigMac,针对计算效率与显存占用难以兼顾的痛点,提出依赖安全的嵌套流水线设计,用 LLM 流水线为主干有序嵌入编码器与生成器计算。实验显示其训练速度较基线提升 1.08 至 1.9 倍,且显存占用保持稳定,目前已应用于 dots 系列模型生产训练。

阿里开源0.8B文档解析模型 OvisOCR2

阿里云开源文档解析模型 OvisOCR2,模型用 96.58 分刷新 OmniDocBench v1.6 榜单纪录,成为首个超越传统流水线方法并登顶的端到端模型。模型仅 0.8B 参数,基于 Qwen3.5-0.8B 后训练,通过真实与合成数据互补引擎及多阶段训练流程,实现文本、公式、表格等内容的单步 Markdown 输出。

7月23·周四

Claude Cowork 新增录制技能,Record a skill

Claude Cowork 上线 Record a skill(录制技能)功能,用户边操作屏幕边语音讲解,AI 自动提炼为可重复调用的 Skill,无需再写繁琐 SOP。该功能面向 Pro、Max 及 Team 用户,入口位于桌面应用 Cowork 模式的「+」菜单。

OpenAI 推出企业级 AI 智能体平台 OpenAI Presence

OpenAI 正式推出企业级 AI 智能体平台OpenAI Presence,帮助企业高效部署和管理 AI Agent,实现客户支持、销售等工作的自动化。平台可将智能体与企业内部数据、管理制度及现有软件深度连接,提供模拟测试、安全防护、人工审核及 AI 自动评分等管理工具,集成语音与聊天技术。

微软开源轻量级多模态图像生成模型系列 Mage-Flow

微软开源轻量级多模态图像生成模型系列 Mage-Flow,基于流匹配架构,仅 4B 参数,包含 Base、RL、Turbo 和 Edit 四个版本,支持文本到图像生成、局部编辑与风格迁移。模型可在消费级 GPU 上高效运行,大幅降低部署门槛,适用于电商设计、广告创意、游戏开发等场景。

腾讯云推出云端智能体 CodeBuddy NPC

腾讯云正式推出云端智能体 CodeBuddy NPC,定位为”住在云端的 AI 员工”。开发者只需在 Issue 中 @NPC 派发任务,智能体可自主完成从方案规划到代码交付的全流程,无需人工干预。CodeBuddy NPC支持多 NPC 组队协同完成复杂任务,首轮 Token 消耗已从 2 万多个降至约 2000,降幅超 90%。

智象未来完成15亿元人民币C轮融资

智象未来(HiDream.ai)宣布完成15亿元C轮融资,由社保基金四川振兴科创基金、工银资本等联合领投,多家国资与产业资本跟投,老股东持续加注。近三月累计融资超21亿元,正式迈入独角兽行列。本轮融资将加速其从多模态大模型向原生全模态世界模型的演进。

商汤科技推出旗舰图片创作模型 SenseNova U1 Pro

商汤在WAIC 2026推出日日新SenseNova U1 Pro,面向复杂多模态任务的AI图像生成系统。U1 Pro支持原生8K直出,具备图文交错思维能力,可围绕目标自主完成草图、细化、着色、检查与调整的全流程。实测显示,模型在超长画幅、复杂海报、琉璃质感山河图及商用电影海报等场景中均表现稳定,文字清晰、构图完整。

7月22·周三

谷歌推出三款新 AI 模型,Gemini 3.6 Flash、3.5 Flash Cyber 和 3.5 Flash-Lite

谷歌推出三款新AI模型:Gemini 3.6 Flash、Gemini 3.5 Flash Cyber 和 Gemini 3.5 Flash-Lite,分别主打性能提升、网络安全优化和智能体应用场景。Gemini 3.6 Flash 在编程、金融等基准测试中表现优于前代,且成本更低。Cyber 版本专为漏洞发现与修复设计,仅向政府机构和可信合作伙伴开放,以防范滥用风险。

腾讯正式全量上线 Miora

腾讯AI创意智能体平台Miora正式全量上线。平台定位为有记忆、能理解需求、能调用多智能体协作的AI创意工作室,用户只需提出目标,Miora可自动拆解任务,将图片、视频、3D、UI等工作交由对应专家处理,保持风格一致。

商汤科技推出「咔皮家族」AI应用矩阵

商汤科技推出「咔皮家族」AI应用矩阵,定位为以Personal Intelligence为核心的全天候生活智能体,累计用户已突破4000万,年增速超500%。该家族包含三位私人高管:「咔皮健康」可将智能手表数据翻译为个性化健康建议;「Kapi相机」基于多模态能力提供AI构图、滤镜与姿势推荐;「咔皮记账」连接日常收支与长期财务目标。

7月21·周二

面壁智能开源首个具身智能系列模型 MiniCPM-Robot

面壁智能在WAIC 2026上开源首个具身智能成果MiniCPM-Robot系列模型,包含通用VLA模型RobotManip与跟踪导航模型RobotTrack。Manip用极小参数实现比肩更大模型的性能,支持1分钟原生记忆且推理成本减半;Track为业内首个支持本地断网部署的跟踪模型,可在无网环境下稳定运行。

昆仑万维开源新一代可交互世界模型 Matrix-Game 3.5

昆仑万维开源新一代可交互世界模型Matrix-Game 3.5。模型通过Patch Memory与Warped PRoPE技术攻克长期记忆与几何一致性难题,实现单卡GPU上720P/20FPS实时交互,且核心功能几乎不新增参数,采用轻量化可迁移架构。团队同步构建自动化数据管线,产出超500万段高质量训练数据。

腾讯混元推出科学发现智能体 Hyra

腾讯混元推出Hyra,首个支持递归自我改进的通用科学发现智能体。Hyra在AI研发三项基准上均超越Recursive系统;在55个数学开放问题上刷新29项历史最优纪录,并设计出参数减少58%的加法器、效率提升44%的量子路由算法及优于上市药物的抗癌分子候选。

元石科技推出新一代长内容生成引擎问小白 5 Pro

元石科技推出问小白 5 Pro,定位为新一代长内容生成引擎,主打长、稳、可查三大核心能力。针对AI长文本写作中常见的数据幻觉、设定前后矛盾、结构松散等痛点,产品通过资料库实现引用可追溯,依托项目记忆机制保持长程设定一致性,借助长文结构保持机制确保万字级文档的论证框架不散架。

阿里通义千问推出语音合成大模型 Qwen-Audio-3.0-TTS

阿里正式推出语音合成大模型Qwen-Audio-3.0-TTS,包含面向实时交互的Flash版本和面向高质量生成的Plus版本。模型在细粒度标签控制、自然语言指令风格定义、多语种与方言覆盖及复杂声学鲁棒性等方面实现系统性提升,支持在文本中嵌入结构化标签精准调控语气与情绪,覆盖16种语言和20种方言。

美团推出下一代搜索智能体评测基准 LoHoSearch

美团LongCat团队推出全新搜索智能体评测基准LoHoSearch,用762万维基百科实体知识图谱自动生成544道高难度题目。基准通过控制搜索空间与结构复杂度双维度提升难度,评测显示最强模型GPT-5.5准确率仅34.74%,远低于其在BrowseComp上的表现,揭示当前搜索智能体在长链条复杂推理任务上的显著瓶颈。

7月20·周一

阿里推出Qwen3.8-Max预览版模型,正式版即将发布并开源

阿里千问推出Qwen3.8-Max-Preview,Qwen3.8将正式发布并全面开源,模型参数达2.4T,官方称模型可能是除Fable 5外最强大的模型。目前Qwen3.8-Max预览版已率先上线阿里Token Plan、Qoder及QoderWork平台,用户可抢先体验。

趣丸科技推出旗舰级AI音乐生成大模型 Tempolor v4.7

趣丸科技发布Tempolor v4.7(天谱乐大模型V4.7),接入对话式音乐智能体Tunee并开放API。新版本聚焦可控编辑,升级Remix改写与翻唱Cover能力,支持细粒度音频调整,让AI音乐从一键成曲走向随心修改。模型采用第四代分层渐进式架构,整体性能提升约20%,输出48kHz双声道音频。

字节跳动Seed推出音频创作模型 Seed Audio 1.0

字节跳动Seed推出音频创作模型Seed Audio 1.0,面向完整声音场景统一建模人声、音效与环境声,实现端到端影视级音频创作。模型支持多要素统一编排与100ms精度时间控制,可基于参考音频保持长时音色一致,覆盖20+语种自然生成。评测显示多数场景音频可用率超90%。

Meshy 宣布完成近 4 亿美元 B 轮融资

Meshy宣布完成近4亿美元B轮融资,投后估值超100亿元,创全球AI 3D领域最高估值纪录。过去一年营收翻12倍,注册用户超1200万,累计生成模型超1亿个,全球前十科技公司中已有一半成为其客户。

7月17·周五

月之暗面推出最强开源 AI 大模型 Kimi K3

月之暗面正式推出迄今最强模型 Kimi K3,模型拥有 2.8 万亿参数,是全球首个开源的 3 万亿级别模型。Kimi K3 基于 KDA 混合线性注意力机制与注意力残差技术构建,原生支持视觉理解,上下文窗口达 100 万 token。在编程、通用 Agent、视觉 Agent 及知识工作等评测中,Kimi K3 展现出前沿水平,部分项目超越 GPT-5.6 Sol 与 Claude Fable

谷歌 NotebookLM 更名 Gemini Notebook

谷歌宣布旗下AI笔记助理NotebookLM正式更名为Gemini Notebook,实现AI产品品牌统一。产品仍保持独立运营,将深度融入Gemini应用及Google搜索生态。同时,Gemini Notebook新增安全云计算机支持,具备原生代码编写与执行能力,可基于数据源进行复杂数据分析。

努比亚发售 AI 宠物机器人 iMoochi

努比亚AI陪伴机器人iMoochi正式上市,售价1699元。产品由中兴通讯在MWC26首发,以萌系毛绒外形与拟生命体交互为核心卖点,通过触摸传感与AI算法实现摇头摆尾、发声反馈等灵动回应,并随使用时间养成独特性格与生活习惯。产品主要面向都市独居人群提供情感慰藉。

英伟达开源的文本嵌入模型系列 Nemotron 3 Embed

英伟达开源文本嵌入模型系列 Nemotron 3 Embed,专为检索增强生成与智能体检索设计。模型包含 8B 和 1B 两种参数规模,支持 32k 上下文窗口与 34 种语言。旗舰版 8B 模型在 RTEB 多语言检索基准以 78.5% 得分位居第一,1B 版本通过剪枝与蒸馏在大幅降低推理成本的同时保留 95% 检索精度。

秒哒3.5,全球首发iOS App 无代码开发、多端共享后端

百度秒哒在WAIC2026现场发布3.5版本,新版本通过内置SEO Agent降低搜索优化门槛,并全球首发iOS打包能力,支持无代码生成应用并直达iPhone。同时新增共享后端与多环境隔离,实现从创作到多端交付的完整闭环,持续推动无代码开发普惠化。

多模态通用智能公司 Prana Labs 完成近千万美金种子轮融资

多模态通用智能公司 Prana Labs 近日完成近千万美金种子轮融资,由元生资本、XVC、Creekstone、三七互娱联合投资。公司定位多模态基础模型公司,致力构建可交互、带物理约束的规模化世界生成系统,让 AI 在虚拟环境中行动、试错并学习物理规律,以此训练下一代通用智能。

7月16·周四

马斯克旗下 xAI 开源 AI 编程智能体 Grok Build

马斯克旗下 xAI 宣布开源 AI 编程智能体工具 Grok Build,并将源代码发布至 GitHub。Grok Build 是整合 Grok 模型的终端 CLI 工具,覆盖规划、搜索、编码、测试到 Git 提交的全流程开发。本次开源涵盖智能体链路、代码工具、终端 UI 及扩展系统,支持完全本地优先运行与自定义推理。

Codex 推出首款编程键盘硬件 Codex Micro

OpenAI 联合外设厂商 Work Louder 正式推出 Codex 首款硬件 Codex Micro,售价 230 美元(约 1556 元),现已开启预购。硬件专为 Codex 设计,通过 RGB 灯光实时映射 AI Agent 的工作状态,让用户无需切换窗口可掌握任务进度。旋钮可动态调节 AI 推理强度,配合摇杆与实体按键,分别用于派发工作流和执行高频决策。

端侧大模型独角兽面壁智能完成新一轮融资,估值超200亿

端侧大模型独角兽面壁智能完成新一轮融资,2026年上半年累计融资超50亿元,估值突破200亿元,成为中国端侧智能领域估值最高的独角兽。公司孵化自清华大学NLP实验室,核心产品为MiniCPM系列端侧模型,5月开源MiniCPM5-1B。公司商业化已进入汽车、手机、PC等领域,长安、上汽、吉利等车型已量产搭载。

阿里通义推出实时语音交互模型 Qwen-Audio-3.0-Realtime

阿里通义实验室推出实时语音交互模型 Qwen-Audio-3.0-Realtime(原 Fun-Realtime-AudioChat),支持语境动态调整语气情感、音色克隆、声纹级背景过滤与多模态双工对话,在 Artificial Analysis 语音推理子项中综合排名第一,超越 GPT-Realtime-2。

7月15·周三

阿里通义开源音乐驱动人像舞蹈视频生成模型 Wan-Dancer

阿里通义万相开源音乐驱动人像舞蹈视频生成模型 Wan-Dancer。用户上传人物照片与音乐,可生成节拍精准、动作流畅的舞蹈视频。模型突破分钟级时序瓶颈,支持 15 秒至 3 分钟 720p 高清连贯输出,覆盖多种舞蹈风格。Wan-Dancer采用全局关键帧规划与局部时序细化的分层架构,有效解决长序列动作漂移难题。

支付宝与OPPO达成智能体跨端互联合作

支付宝与OPPO宣布达成智能体跨端互联合作,支付宝AI智能体「阿宝」正式接入OPPO AI助手「小布」。即日起,OPPO用户无需打开App,仅通过语音对话可让小布调用阿宝完成充话费、购票、查询公积金等近 200 项 生活服务,实现一句话办事。

小米开源多模态自回归具身生成基础模型 Xiaomi-Robotics-U0

小米开源 Xiaomi-Robotics-U0,380亿参数多模态自回归具身生成基础模型。模型是具身领域首个统一覆盖场景生成、轨迹迁移、交互视频及通用图像编辑四类任务的生成模型。模型通过五维解耦结构化控制实现精准可控生成,搭载 FlashAR+ 推理加速方案,效率提升近83倍。

高德推出通用世界模型工坊 ABot-World Studio

高德推出通用世界模型工坊 ABot-World Studio。产品首次将交互式视频生成与 3DGS 场景生成统一,用户输入文字或图片可创建可实时交互、任意分享的 AI 世界。ABot-World Studio 支持单张 5090 本地部署,单次连续推理可稳定运行超 1 小时,内置时空任意门实现跨场景跃迁。

7月14·周二

爱诗科技完成 29.8 亿元 C 轮融资

爱诗科技宣布完成整体C轮融资,累计金额29.8亿元,C+轮由阿里巴巴领投,十余家国内外机构参投。资金将用于视频生成基础模型、实时世界模型研发及全球化产品增长。公司旗下PixVerse全球用户超1.5亿,年初推出全球首个支持1080P的通用实时世界模型PixVerse R1,并与芒果传媒、阿里巴巴等产业伙伴达成战略合作。

阶跃星辰推出首款大模型原生智能体手机 STEPX Neo

阶跃星辰推出首款AI智能体手机STEPX Neo,搭载自研智能体原生操作系统Step AOS,内置系统级个人智能体Amoo。用户可通过自然语言指令实现跨应用自主调度。系统具备长期记忆、端云协同能力,支持”能端则端、需云则云”的灵活任务路由。首批生态合作伙伴包括支付宝、美团、高德、滴滴、京东、百度等主流应用。

爱诗科技推出首个实时视频游戏引擎 PixVerse Game

爱诗科技亮相联合国AI for Good全球峰会,联合创始人谢旭璋展示实时视频、世界模型与AI互动娱乐最新探索,发布首个实时视频游戏引擎PixVerse Game。引擎将完整游戏体验构建在实时互动视频流之上,创作者仅需定义规则与玩法,角色场景可实时生成。

Looki 完成数亿元 A1 轮融资

Looki(光智时空)完成数亿元A1轮融资,元生资本领投,BAI资本等老股东加注。公司定位个人智能可穿戴赛道,通过PIE主动式AI引擎2.0实现从”被动响应”到”主动预测”的升级,结合场景理解与长期记忆预判用户下一步需求。其首款可穿戴多模态AI硬件Looki L1出货量预计达10万台。

LibTV 推出专业视频创作智能体 LibTV Agent

哩布哩布AI旗下LibTV正式推出LibTV Agent,定位全球首个专业视频创作智能体。产品围绕成片能力构建,推出高基线全能视频Agent、全球最大专业视频Skill Hub、双视图创作与Agent驱动剪辑四大核心能力。首批上线超百个导演级Video Skill,覆盖影视广告、短剧、自媒体等领域,3分钟以内视频成功率超80%。

7月13·周一

阶跃星辰推出端侧模型全家桶 Step Edge

阶跃星辰推出端侧模型全家桶 Step Edge,包含基础模型、Audio、GUI、Gen 四个方向,面向手机、汽车等终端场景。该系列支持 0.1 秒 超低本地延迟,实现全模态隐私保护,采用原生端云协同架构。在 29 项核心评测中,Step Edge 覆盖文本视觉、音频、GUI、图像生成等方向均取得第一。

商汤开源理解生成统一视觉大模型 SenseNova-Vision

商汤正式开源日日新SenseNova-Vision理解生成统一视觉大模型,将检测、分割、深度预测、3D重建等经典视觉任务原生融入大模型体系。依托数据反哺与思维赋能的双向增益,模型在零样本泛化、超稠密分割及镜面反射理解等复杂场景展现强悍能力。

腾讯混元开源端到端 OCR 大模型 HyOCR-1.5

腾讯混元开源 HyOCR-1.5,业界首个训推全开源的端到端 OCR 专家大模型。模型引入 DFlash 投机解码,Transformers 下推理提速 6.37 倍,vLLM 下提速 2.14 倍;OmniDocBench v1.6 以 94.74 分登顶端到端第一。HyOCR-1.5 支持文档解析、古文字识别、图表解析、多页问答等 8 类任务,覆盖 331 种语言。

OpenAI Codex、ChatGPT Work 暂时取消5小时使用限制

OpenAI Codex工程负责人Thibault Sottiaux宣布,Codex和ChatGPT Work已暂时取消Plus、Business及Pro订阅的5小时使用限制。同时,GPT-5.6 Sol模型将优化效率以减少用量消耗,使用用户在同等额度下能完成更多任务。

Agnes AI 推出新一代高性能文本模型 Agnes-2.5-Flash

Agnes AI推出新一代文本模型Agnes-2.5-Flash,Coding能力跻身全球第一梯队。同步上线Agnes Code桌面端,支持本地项目开发。实测中,模型3分钟定位修复隐藏Bug,可独立完成复杂网页应用,还能跨十几个文件联动改造大型项目。

7月10·周五

OpenAI 正式推出最新一代大语言模型系列 GPT-5.6

OpenAI正式推出GPT-5.6系列模型,包含旗舰Sol、均衡Terra和性价比Luna三款,API价格梯度覆盖$1-$30/百万token。在Agents’ Last Exam评测中,Sol以53.6分超越Claude Fable 5达13.1分,编程智能体指数更创80分新高,且成本与耗时均大幅降低。

Meta 向开发者开放 Muse Spark AI 模型 API

Meta正式向开发者开放Muse Spark AI模型API,并发布升级版Muse Spark 1.1,标志着模型正式加入AI模型商业化竞争。模型是Meta迄今在编程与智能体任务上最强的模型,支持代码编写、工具调用及多模态理解。

OpenAI 推出 ChatGPT 智能体工作台 ChatGPT Work

OpenAI推出全新ChatGPT Work智能体。产品由Codex与GPT-5.6驱动,定位为可承担长时间、多步骤任务的智能体,支持跨网页、移动设备和桌面平台完成实际工作。用户只需通过单一指令描述目标,可让AI接管整个工作流程,利用应用和文件上下文创建文档、幻灯片、分析、网站和报告。

蚂蚁灵波科推出行业首个具身原生世界动作模型 LingBot-VA 2.0

蚂蚁灵波科技推出行业首个具身原生世界动作模型 LingBot-VA 2.0。模型基于自回归架构从零预训练,采用语义视觉-动作分词器、因果预训练范式、MoE 架构及异步推理机制四大核心设计,实现单卡 150Hz 实时推理,让机器人具备边推演、边行动的通用控制能力。

快手推出旗舰级 Agentic Coding 模型 KAT-Coder-Pro V2.5

快手KwaiKAT正式推出旗舰级Agentic Coding模型 KAT-Coder-Pro V2.5,在长程工程能力、通用Agentic能力及大规模强化学习三方面实现突破。通过AutoBuilder自动化流水线构建超10万个可运行仓库环境,采用多框架RL训练与多专家融合(MOPD)技术,模型在SWE-Bench Pro、PinchBench等评测中取得领先成绩。

7月9·周四

字节跳动推出多模态图像创作模型 Seedream 5.0 Pro

字节跳动Seed团队推出多模态图像创作模型Seedream 5.0 Pro,模型在图文匹配、文字渲染与画面美感等基础能力上全面提升,实现复杂信息可视化、交互式精准编辑、真实影像质感还原及原生多语种生成四大突破,可将数据与密集文字直接转化为专业排版,支持点选圈选等精细化操控。

OpenAI 推出的新一代语音模型 GPT-Live

OpenAI推出全新语音交互模型GPT-Live,支持实时同声传译与全双工对话,用户可随时插话打断。模型支持自定义推理强度,并引入深度任务委托机制,前台保持流畅语音交互的同时,后台可并行处理联网搜索、复杂推理等任务。在对话中可实时弹出天气、赛事等可视化卡片。

SpaceXAI推出新一代旗舰大语言模型 Grok 4.5

SpaceXAI推出旗舰模型Grok 4.5,采用1.5T参数MoE架构并与Cursor联合训练,性能对标Claude Opus。模型推理速度达80 TPS,编程能力在DeepSWE Bench上超越Opus 4.8,且Token效率提升4倍以上,支持50万上下文,下周将升级至百万,月底还将推出2T参数版本。

阿里元境推出一站式AI大模型聚合平台 JellyToken

阿里元境正式推出JellyToken(智渲云)国内主流AI大模型一站式API聚合平台。用户仅需一个API Key可调用通义千问、DeepSeek、豆包、智谱、月之暗面等60余款国产模型,覆盖文本、图像、视频、音频四大场景。平台提供智能路由、负载均衡、Token级精准计费及正规发票等企业级能力,帮助开发者与企业降低多模型接入门槛与运维成本。

蚂蚁灵波开源面向具身智能的视频生成基础模型 LingBot-Video

蚂蚁灵波科技开源LingBot-Video,是全球首个基于MoE架构、面向具身智能的视频生成基础模型。模型总参数30B,推理时仅激活约3B,效率为同等Dense架构的3倍。团队构建了7万小时具身数据集,引入多维强化学习奖励系统,强化物理合理性与任务完成度。

Mistral AI 推出具身智能导航模型 Robostral Navigate

Mistral AI推出具身智能导航模型Robostral Navigate,单RGB摄像头可让机器人在复杂环境自主导航。模型参数8B,在R2R-CE未知环境测试中成功率达76.6%,超越多传感器方案。模型采用指向预测目标位置策略,结合前缀缓存技术将训练周期从数月缩至数天,通过在线强化学习持续自我改进。

7月8·周三

Claude Cowork 扩展至网页与手机端

Anthropic 宣布 Claude Cowork 任务智能体正式扩展至网页端与移动端,支持跨设备延续会话与文件操作。更新后,用户可在桌面端发起任务、手机端查看进度,定时任务更支持离线后台运行。关键决策时,Claude 会向用户手机发送确认请求。目前该功能处于测试阶段,首批面向 Max 订阅用户。

Meta 超级智能实验室推出 AI 图像生成模型 Muse Image

Meta超级智能实验室推出首个自研AI图像生成模型Muse Image。模型作为代理运行,与Muse Spark配合进行多步骤规划,支持文生图、图像编辑、文字渲染及二维码生成,在Arena AI排行榜位列第二。Muse Image为Instagram Stories提供超30种AI特效,日常创作免费,超额需订阅。

蚂蚁灵波推出空间感知模型 LingBot-Depth 2.0

蚂蚁灵波科技推出空间感知模型LingBot-Depth 2.0,训练数据从300万扩充至1.5亿,深度补全基准16项测评获12项第一,室内深度误差减半。同步开源视觉基座模型LingBot-Vision,业内首创边界结构预训练,仅1.6亿图像实现亚像素级边界定位。LingBot-Depth 2.0已通过奥比中光认证,双方将合作推出SDK及一体化相机产品。

智源研究院推出多模态表征世界模型悟界·RoboBrain Orca

智源研究院推出悟界·RoboBrain Orca多模态表征世界模型。模型通过12.5万小时视频进行无意识学习,结合1.6亿条事件标注进行有意识学习,构建统一世界潜在表征空间。在文本生成、图像预测和具身动作生成等下游任务中,模型表现优于同等规模基线模型。

物理 AI 公司 Momenta 正式挂牌上市,市值突破700亿港元

Momenta正式在港交所挂牌上市,股票代码6880.HK,成为”物理AI第一股”。首日开盘涨超6%,总市值突破700亿港元,募资约68亿港元。公开发售获414倍超额认购,14家顶级基石投资者护航,包括GIC、富达、奔驰、比亚迪等。

7月7·周二

字节跳动推出超长程评测集 EdgeBench

字节跳动Seed团队推出超长程评测集EdgeBench,用于衡量AI Agent在真实世界环境中的持续学习能力。评测集包含134个真实任务,覆盖科学、软件工程、知识工作等六大领域,每个任务支持12小时以上连续运行。研究发现,Agent在环境交互中的学习轨迹遵循高精度log-sigmoid曲线,且前沿模型的学习速度每三个月翻一倍。

支付宝 AI 开放平台开放邀测

支付宝AI开放平台正式上线并开放邀测,面向商家与开发者提供一次接入、多端分发的AI化升级服务。商家可将存量小程序和API一键升级为MCP、Skill或Agent,通过阿宝触达支付宝10亿用户,同时跨端覆盖手机、车机、AI眼镜等智能终端。

腾讯 AI 生成应用 App「吐司」苹果 iOS 版上线

腾讯AI生成应用App”吐司“正式上线苹果iOS版,安卓版已于上月推出。产品定位为探索型氛围编程工具,可由AI梳理功能并精细化编辑打磨,设有灵感广场与优质模板,支持用户共创应用。平台让无代码基础的用户能将想法转化为真实可用的App,形成想法→应用→分发→共创闭环生态。

上海 AI Lab 开源国产科研智能体工作台 InternAgentS

上海AI实验室开源国产科研智能体工作台 InternAgentS,面向AI for Science领域提供可本地部署、多模型适配的科研协作平台。平台将论文阅读、实验分析、代码迭代、远程计算与科研写作等全流程整合至统一项目空间,支持接入DeepSeek、Qwen、Kimi等国产及私有模型,打通3600余个科研工具与Skills。

7月6·周一

阿里推出Qoder企业版,支持企业知识库与Credits灵活分配

阿里云推出Qoder企业版,为企业提供提供个人云端知识库QMind,支持跨产品、跨设备、跨人员的知识共享,可整合RepoWiki、本地文件、URL等多源数据为可复用资产。同时上线资源池化Credits付费模式,企业管理员可按需动态分配额度等。安全方面覆盖传输加密、访问控制、AI运行时等五层防护,已通过ISO 27001认证。

美团 LongCat-2.0 开源,同步开放国产卡推理代码

美团正式开源万亿参数大模型 LongCat-2.0,总参数 1.6T、平均激活 48B,专为 Agentic Coding 任务设计。模型创新性引入 LongCat 稀疏注意力与 N-gram Embedding,提升长上下文处理与代码执行表现,率先在五万卡国产算力集群上完成推理验证。本次开源同步提供 BF16/FP8/INT8 多精度版本及国产芯片优化推理代码。

腾讯混元开源混合专家模型 Hy3

腾讯混元正式推出Hy3大模型,基于preview版本提升后训练数据质量与RL算力规模,在推理、智能体、长上下文等任务上显著进步,效果比肩参数规模2-5倍的旗舰模型。幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%,多轮问题率从17.4%降至7.9%。

阿里开源实时语音识别大模型 Fun-ASR-Realtime

阿里正式推出升级后的实时语音识别大模型Fun-ASR-Realtime,首字延迟控制在百毫秒级别,识别准确率接近离线模型,支持16种方言和30种语言。模型具备上下文理解能力,可自我纠错;在16种方言识别测试中字符准确率平均88.62%,领先火山与腾讯相关产品。

商汤科技推出 SenseNova U1 信息图增强版 V2

商汤日日新SenseNova U1信息图增强版V2正式发布,模型基于8B-MoT架构实现更轻量开放的高信息密度图像生成能力。新版本核心升级小字清晰度、复杂排版结构与视觉质感,让AI生成信息图向专业设计师水准看齐。

生数科技推出实时交互模型 Vidu S1

生数科技在2026全球数字经济大会推出Vidu S1实时交互模型。模型支持语音控制视频走向、无限时长连续互动,可达540P分辨率与25FPS流畅帧率。用户上传一张图片可创建真人、动漫或萌宠等个性化交互角色,无需建模训练。

Mistral AI 开源形式化验证大模型 Leanstral 1.5

Mistral AI 开源形式化验证大模型 Leanstral 1.5,专为 Lean 4 自动定理证明优化。模型采用 119B 参数 MoE 架构,每 token 仅激活 6.5B 参数,支持 256k 超长上下文与图文输入。在 miniF2F、PutnamBench 等数学证明基准上达到 SOTA 性能。模型已开源至 HuggingFace,支持本地部署与在线体验。

7月3·周五

谷歌开源零样本表格基础模型 TabFM

谷歌开源零样本表格基础模型TabFM,支持对混合数值与类别特征的结构化数据进行分类和回归,无需微调或超参数搜索。模型在数百亿合成表格数据上预训练,采用Transformer序列架构,在TabArena基准51个数据集上超越梯度提升树等强基线。

英伟达开源双塔架构扩散语言模型 Nemotron-Labs-TwoTower

英伟达开源Nemotron-Labs-TwoTower,基于预训练自回归骨干的离散扩散语言模型,能解决大模型Token生成速度瓶颈。模型总参数60B,采用双塔架构——30B自回归上下文塔与30B扩散去噪塔,各塔激活3B参数。上下文塔保持冻结维护自回归上下文,去噪塔负责噪声块去噪,两者通过逐层交叉注意力协作。

阿里全面禁用Claude

阿里巴巴内部宣布全面禁用Anthropic旗下Claude系列产品,包括Sonnet、Opus、Fable等多个系列模型,以及Claude Code等Agent产品。导火索是Claude Code被曝存在植入后门的安全风险,其从2.1.91版本起内置隐蔽木马系统,通过检测本地时区和代理关键词标记中国用户。

7月2·周四

快手旗下可灵AI将完成30亿美元融资

快手旗下AI视频生成业务可灵AI将完成30亿美元(约203.8亿元)融资,腾讯参与了本轮融资,投后估值180亿美元,较此前200亿美元目标下调20亿美元。快手预计12个月内启动可灵AI赴港IPO,募资将用于算力建设和人才引进。可灵AI年化收入已超3亿美元,Q1收入7500万美元,主要来自海外市场。

AI 版支付宝开放公测,无需邀请码即可体验

支付宝AI智能体”阿宝“结束内测,正式面向iOS和安卓用户开放公测,无需邀请码即可体验。用户可在应用商店或支付宝App内搜索”阿宝”或”蚂蚁阿宝”可直接使用。阿宝从海量办事服务中整理出72项技能,涵盖居家保洁、出行订票、购物优惠、社保查询、账单分析等72项生活服务,支持模糊口语理解、全场景服务覆盖及长期陪伴互动。

昆仑万维天工 3.2 推出团队级 AI Agent 协作功能 Skywork Tags

昆仑万维天工 3.2 升级上线 Skywork Tags,支持将 Skywork Agent 接入 Slack、飞书、钉钉、Discord、Telegram 等即时通讯工具,以”团队成员”身份常驻工作群聊。区别于让用户迁移上下文到独立平台的传统模式,Skywork Tags 直接进驻团队现有沟通环境,无需导出聊天记录或切换窗口。

xAI推出生产级语音智能体平台 Voice Agent Builder

xAI推出Voice Agent Builder测试版,基于Grok Voice端到端语音模型的零代码生产级语音智能体平台。用户用自然语言描述,2分钟可配置智能体,支持SIP接入、知识库实时检索、Google Calendar等工具连接及MCP集成。平台提供80+内置语音和品牌克隆功能,具备完整可观测性与护栏机制。

元空AI推出企业级桌面版 AI 数据智能体 ChatExcel Ultra

ChatExcel Ultra桌面版正式上线,定位为企业级AI数据办公工具。产品将数据安全与本地化处理能力——文件全程留在本地电脑和企业内网,不经过外部服务器,满足财务、医疗、政务等敏感场景的合规需求。同时支持数据库直连与跨库联合分析,用户无需编写SQL可用自然语言完成复杂查询。

Meta 开源 React 设计系统 Astryx

Meta正式开源React设计系统Astryx,目前处于Beta阶段。系统基于React与StyleX构建,历经8年内部打磨,支撑Facebook、Instagram等超1.3万个应用。系统提供150+可访问组件、品牌级主题、暗黑模式、即用型模板及CLI工具集,开发者无需额外构建插件,导入预编译CSS即可使用。

7月1·周三

Anthropic推出最强智能体模型 Claude Sonnet 5

Anthropic推出Claude Sonnet 5,定位为其最具Agent能力的Sonnet模型,支持制定计划、调用浏览器和终端等工具自主执行复杂任务,整体能力接近Opus 4.8但价格更低。模型已面向所有套餐开放,成为Free和Pro用户默认模型,支持Claude Code和Platform调用。

谷歌推出轻量级 AI 图像生成模型 Nano Banana 2 Lite

谷歌推出AI图像模型Nano Banana 2 Lite,4秒可生成一张图像,每1000张收费0.034美元,主打速度与批量处理能力,适合高频内容生产场景。模型已上线谷歌AI Studio、Gemini API及企业平台,将取代初代Nano Banana。

Anthropic 推出 AI 科研工作平台 Claude Science

Anthropic 推出面向科学家的AI工作平台 Claude Science。平台提供统合式研究环境,可帮助科研人员分析文献、执行多步骤研究、生成详细成果,支持反复完善图表与文稿直至发表标准。每个输出均提供可审计的生成历史记录,确保结果可验证与复现。平台内置超60种精选技能与连接器,配备审阅智能体进行核查。

AI 芯片初创公司 Etched 完成流片,获得8亿美元融资

Transformer专用AI芯片初创公司Etched完成A0芯片流片,并获得8亿美元融资及10亿美元客户订单。公司由哈佛辍学生创立,获卡帕西、李飞飞、辛顿等AI巨头投资。Etched推出首款机柜产品,采用低电压推理(LVI)和集群规模内存(CSM)技术,专为万亿参数级MoE模型推理优化,计划今夏出货。

6月30·周二

OpenAI 推出首款 AI 硬件,Codex 联名键盘

OpenAI 开发者官方账号 6 月 30 日在 X 平台宣布,将与客制化键盘厂商 Work Louder 合作推出 Codex 品牌专用输入设备,定于 7 月 15 日上线。设备基于 Creator Micro 2 微型快捷键盘打造,配备 12 个可自定义机械按键、八向摇杆及无极旋转旋钮,专为 AI 开发场景优化。

美团开源新一代万亿参数大模型 LongCat-2.0

美团正式开源万亿参数大模型 LongCat-2.0,模型总参数 1.6T、平均激活 48B,是业界首个在五万卡国产算力集群上完成全流程训练与推理的模型。模型原生支持 1M 超长上下文,专为 Agentic Coding 任务优化,预览版已跻身 OpenRouter 全球调用量前三。

腾讯视频推出工业级 AI 漫剧制作平台 WorkRally

腾讯视频推出工业级AI漫剧制作平台 WorkRally,面向2D/3D动漫及AI仿真人剧,覆盖剧本解析、分镜生成、内容生产到资产管理的完整链路。平台内置S+级影视动漫技能库,支持专家级Agent生成与智能流水线调度,可实现角色一致性管理与穿帮检测。

清华系初创「厘清智能」完成数亿元种子轮融资

清华系初创厘清智能完成数亿元种子轮融资,顺为资本、红杉中国、高瓴创投等参投。团队由清华AI学院助理教授李一鸣创立,团队平均年龄23岁。公司拒绝”世界模型”标签,定位Physical AI基础设施商,自研数据管线与可微物理引擎,实现Real-to-Sim-Real闭环,可用1%真机数据达同等训练效果。

华为开源盘古920亿参数模型 openPangu-2.0-Flash

华为正式开源920亿参数的 openPangu-2.0-Flash 模型,基于昇腾原生训练与推理技术,为 Agent 时代打造智能底座。模型权重、基础推理代码及训推算子已上线开源平台,Pro 版将于7月发布,更多组件下半年陆续推出。

全球金融科技平台 Airwallex 空中云汇完成H轮3.2亿美元融资

全球金融科技平台 Airwallex 空中云汇宣布完成 H 轮 3.2 亿美元融资,投后估值达 110 亿美元,半年内从 80 亿美元跃升约 40%。本轮由 Addition 领投,多家国际机构跟投。公司同步发布两款 AI 产品:AI 原生财务平台 T:0与智能体消费者钱包 Airi,资金将用于 AI 产品研发、全球合规布局及团队扩充。

6月29·周一

OpenAI 推出最新一代大语言模型系列 GPT-5.6

OpenAI 推出 GPT-5.6 系列限量预览版,包含旗舰 Sol、平衡 Terra 和性价比 Luna 三款模型。Sol 在编程、网络安全和生物学领域表现突出,新增 max 深度推理和 ultra 多 Agent 协同模式;Terra 以 GPT-5.5 一半价格提供同等性能;Luna 主打轻量高速。模型因应美国政府要求改为限量预览,原计划为开放访问。

DeepSeek 联合北大开源推测解码加速框架 DSpark

DeepSeek 与北京大学联合推出大模型推理加速框架 DSpark,已进入 DeepSeek-V4 系列生产系统。在总吞吐不变的情况下,DeepSeek-V4-Flash 单用户生成速度提升 60%–85%,DeepSeek-V4-Pro 提升 57%–78%。DSpark 采用半自回归架构与置信度调度验证机制,兼顾草稿生成速度与连贯性,能根据系统负载动态调整验证长度。

高德推出 AI 应用生成平台「袋马」

高德内测Vibe Coding产品「袋马」,主打自然语言驱动零门槛构建应用,聚焦微信小程序与iOS原生场景,可快速生成可直接上线、真机可用的应用。产品面向无专业研发团队的个人从业者与中小主体,用户无需编程知识,通过自然语言描述需求可生成完整App,支持获取真机二维码测试与持续迭代。

阿里通义千问推出独立AI语音输入法「千问输入法」

阿里巴巴通义千问团队推出独立AI语音输入法「千问输入法」,主打”说得随意,写得漂亮”。产品底层接入千问大模型CosyVoice能力,能语音转文字,更能理解语义、自动去除语气词、纠正口误,将散装口语整理为结构化书面文本。千问输入法支持最快300字/分钟输入、9种方言识别与中英混说。

生数科技推出的 AI 陪伴应用 Vidy

生数科技推出AI陪伴应用 Vidy,定位”AI Vibe Buddy”,支持文字、语音及实时通话互动。产品内置Humi等差异化AI角色,搭载关系成长记忆系统,可随对话积累理解用户习惯与情绪。依托自研U-ViT架构和Vidu视频大模型,Vidy计划实现AI形象实时表情动作生成,将陪伴从文字语音推向面对面视频通话层级。

自变量连续完成4轮融资,估值超过200亿元

自变量(X SQUARE ROBOT)两个月内连续完成四轮融资,投后估值突破200亿元,成为大湾区首家估值超200亿元的具身大脑公司。 投资方超30家,美团、阿里、字节、小米四大互联网巨头分别领投各轮次,小米连续三轮加注,58集团、奇瑞、中国移动、红杉中国等悉数入场。

6月26·周五

DeepReinforce 开源 Agentic 编程系列模型 Ornith-1.0

DeepReinforce团队推出开源Agentic编程模型Ornith-1.0,基于Gemma 4与Qwen 3.5基座,采用自改进训练框架。模型涵盖9B至397B四种规格,在Terminal-Bench 2.1和SWE-Bench Verified基准上达到同级SOTA。旗舰397B版本得分77.5/82.4超越Claude Opus 4.7;35B MoE版以64.4分超越Qwen 3.5-

腾讯混元开源 4B 参数手机 Agent 模型 PhoneBuddy

腾讯混元开源PhoneBuddy 4B手机Agent模型,同步推出PhoneWorld、PhoneHarness等5篇论文,系统覆盖环境、训练、执行、隐私与安全全链路。模型核心创新采用Real+Mock混合RL训练,将真实App与自建PhoneWorld mock环境结合,使4B模型在150项真机评测中多项指标超越GPT-5.4。

Mistral AI 推出新一代文档识别模型 Mistral OCR 4

Mistral AI 推出最新文档识别模型 Mistral OCR 4,支持横跨10个语族的170种语言,在OmniDocBench基准上获得93.07分。相比GPT 5.5 Pro、Gemini 3.1 Pro Preview等竞品,模型输出更受人类青睐。模型在输出文本的同时可提供边框、区域分类和置信度评分,支持RAG语义分块等下游工作负载。

6月25·周四

OpenAI 推出首款自研推理加速芯片 Jalapeño

OpenAI 发布首款自研推理芯片 Jalapeño,联合博通与 Celestica 打造,专为 ChatGPT、Codex 等模型量身定制。项目由前谷歌 TPU 核心成员 Richard Ho 主导,仅用 270 天完成从设计到流片,创高性能 ASIC 最快纪录。芯片通过优化数据搬运与资源平衡提升实际利用率,计划 2026 年底部署,每瓦性能大幅优于现有方案。

华为宣布全机型开放鸿蒙龙虾「小艺 Claw」

华为宣布鸿蒙”龙虾”小艺 Claw 全机型开放,HarmonyOS 5.0 及以上机型只需将小艺 App 升级至 11.6.4.300 及以上版本即可使用。同时小艺 Claw 的套餐服务同步更新,49 元体验包上线 Auto-Model 模式,199 元标准包支持 openPangu-2.0-Pro、DeepSeek V4-Flash、DeepSeek V4-Pro、Min

阿里云推出 AI 语音输入法 CosyVoice

阿里云推出新一代AI语音输入法CosyVoice,搭载千问大模型,支持语音实时转写、自动过滤口语冗余、识别自我修正及结构化整理。工具可理解用户意图生成制式文稿,支持上海话、粤语、四川话等多种方言转普通话。工具主打大模型深度赋能的语义级理解与文本再生成能力,区别于传统语音输入法仅做声学转写。

阿里云推出 AI 互动故事创作与阅读平台「向尾」

阿里云推出AI互动故事创作与阅读平台「向尾」,支持从零起稿、文稿续写及长篇小说分章规划三种模式,覆盖网文、剧本、儿童故事等场景。阅读时AI实时生成场景背景图,读者可在关键节点选择剧情走向或自定义输入,平台即时续写并保持人设一致。

网易有道开源 TTS 语音合成引擎 Confucius4-TTS

网易有道开源TTS模型 Confucius4-TTS。模型实现三大突破:3秒零样本语音克隆、14种语言跨语种无口音合成,以及情感韵律迁移。模型底层采用语音编码器+大语言模型+流匹配生成的端到端架构,完整54G权重支持本地离线部署。

6月24·周三

豆包正式推出专业版

豆包专业版正式上线,基于豆包2.1系列大模型推出全新办公任务模式,支持本地电脑操作、浏览器、Skills技能调用、定时任务及内置Office套件,可完成文档处理、应用开发、数据分析等专业工作。订阅采用三级阶梯定价:标准套餐68元/月、加强套餐200元/月、高级套餐500元/月;大学生认证可享38元/月专属优惠。

火山引擎推出音频创作模型「豆包音频生成模型1.0」

火山引擎推出豆包音频生成模型1.0,首次支持文本或音频参考输入,可端到端生成目标音频。模型能在单条Prompt中编排多角色对白、情绪语气、背景音乐与环境氛围,直接产出完整音频作品,可在长时生成中保持音色一致性。

Anthropic 推出企业级 AI 协作工具 Claude Tag

Anthropic 推出 Claude Tag 企业级 AI 协作工具,将 AI 从一问一答升级为常驻 Slack 频道的虚拟同事。团队成员可 @Claude 分配任务,工具阁能自动拆解、调用工具、执行并汇报结果,支持多人接力协作、持续性组织记忆、主动监控提醒及异步长任务处理。

通义千问推出原生语言世界模型 Qwen-AgentWorld

阿里通义正式推出 Qwen-AgentWorld,首个原生语言世界模型,可在 MCP、Search、Terminal、SWE、Web、OS、Android 七大领域模拟智能体交互环境。模型基于超 1000 万条真实环境轨迹,经 CPT→SFT→RL 三阶段端到端训练,在自研评测基准 AgentWorldBench 上整体模拟质量超越 GPT-5.4、Claude Opus 4.8 等顶尖模型。

TRAE Work 推出 Design 模式,对话即设计、画布即原型

TRAE Work 推出全新 Design 模式,桌面端与网页端同步全量上线。用户可通过自然语言对话生成设计方案,在画布中实时修改并生成可交互原型。该模式支持导入 Figma 等已有设计资产,能一键将设计稿导出至 Code 模式,实现从设计到开发的一站式衔接。

百川智能推出医疗增强大模型 Baichuan-M4

百川智能联合清华大学推出新一代医疗增强大模型 Baichuan-M4,在 HealthBench 三项榜单登顶世界第一,幻觉率仅3.3%为行业最低。Baichuan-M4具备深度主动问诊、全病程记忆、证据锚定及 Agent 调度四大核心能力,由 Baichuan-Harness 自主编排诊疗流程,实现从会答题到会看病的跨越。

Momenta 冲刺港股”物理AI第一股”IPO

自动驾驶公司 Momenta 冲刺港股”物理AI第一股”IPO,正式将自身定位为物理AI基座模型构建者。其R7世界模型已量产上车,依托超120亿公里真实行驶数据与预训练—仿真—强化学习三层架构,实现对物理世界的理解与推演。公司营收三年翻三倍,许可收入激增42倍,商业模式正从项目制转向规模化License收费。

6月23·周二

影眸科技完成数亿元新一轮融资

影眸科技完成数亿元新融资,本轮融资由凯辉基金、上海国投先导领投,老股东持续跟投。同步发布最新3D生成模型Hyper3D Rodin Gen-2.5,首次引入大语言模型先思考再生成模式,支持五档思考深度,最快4秒生成百万面模型,同步推出全球首个12K精度原生3D贴图模型。

字节跳动推出全新智能体模型 Seed2.1

字节跳动推出 Seed2.1 系列模型,定位为面向真实生产力场景的全新智能体。模型在通用 Agent 能力、代码端到端交付及多模态理解三大维度显著提升,在 Workspace Bench、GDPval、MobileWorld 等多项基准测试中表现领先,Coding 场景众测胜率超 Claude Opus 4.6。

TRAE Work中国版支持豆包2.1,免费体验

TRAE Work中国版于豆包2.1模型发布Day0完成接入并同步上线,第一时间免费向全量用户开放体验。豆包2.1是字节跳动全新一代模型,包含Pro与Turbo版本,具备更可靠的通用Agent能力、更稳定的代码工程交付能力及更强劲的多模态基础能力。TRAE IDE暂时仅对速通Ultra与优速通Express用户开放。

字节跳动推出最新视频生成模型 Seedance 2.5

2026火山引擎FORCE原动力大会上,正式推出豆包视频生成模型Seedance 2.5。模型处于内测尾声,预计7月初上线,模型实现三大全球突破:单段原生视频直出30秒,支持50个全模态参考素材联合输入,并支持局部可控编辑。Seedance 2.5可稳定承接专业3D资产创作,输入近10万面白模可生成稳定渲染视频。

百度开源端到端长文档 OCR 模型 Unlimited-OCR

百度开源全新OCR模型 Unlimited OCR,主打一次性解析数十页长文档,在 OmniDocBench 上刷新 SOTA,综合得分 93.23%,超越 DeepSeek OCR。模型核心创新为参考滑动窗口注意力(R-SWA)机制,通过”软遗忘”策略使 KV Cache 保持恒定,推理速度不随文档长度增长,6000 Token 时 TPS 提升约 35%。

美国AI推理芯片独角兽 Groq 完成6.5亿美元融资

美国AI推理芯片独角兽 Groq 宣布完成 6.5亿美元融资,用于全球AI推理云扩张,目标2027年算力达 200兆瓦。Groq此前与英伟达达成 200亿美元授权协议,核心团队已加入英伟达;现聚焦推理云业务,运营13座数据中心,服务超500万开发者,并任命全新领导团队。

6月22·周一

微信小范围内测原生AI助手「小微」

微信「小微」AI助手启动小范围内测,用户可在主界面左上角通过绿色眼睛图标进入。小微支持文字或语音对话操作微信原生功能,包括调整设置、发送消息、调起小程序、生成图片等,主模型为微信自研WeLM,部分回答调用DeepSeek。同时,小微具备一句话生成小程序能力。

港股智谱总市值突破 1 万亿港元

港股智谱总市值首次突破1万亿港元,年内涨超2000%,总市值达1.27万亿港元。此前智谱开源的GLM-5.2模型在全球百万用户盲测的Code Arena前端开发评估中位列可用模型第一。

腾讯QQ邮箱推出 AI Agent专属邮箱服务 Agently Mail

腾讯QQ邮箱推出 Agently Mail,专为 AI Agent 打造的独立邮箱服务。Agent 可通过微信扫码授权获得专属邮箱地址,与个人邮箱完全隔离,支持收发邮件、管理附件、搜索过滤等完整功能。目前服务已上架腾讯 SkillHub,三步安装即可使用。

阿里 HappyHorse 1.1视频模型上线堆友

堆友平台正式上线HappyHorse 1.1视频生成模型,新版本模型在动态表现力、生成一致性、视觉质感、指令遵循、文字稳定性及镜头语言五大维度实现系统性优化。用户可通过堆友官网直接体验。

Claude Code 上线 Artifacts,可将会话过程实时变成网页

Anthropic宣布Claude Code支持Artifacts功能,可将代码修改、故障排查等会话内容实时生成为可共享的交互式网页,支持团队同步查看进展。该功能基于完整会话上下文自动生成,页面随工作持续刷新,默认私有且仅限组织内分享。目前Artifacts以Beta形式向Team和Enterprise用户开放。

6月18·周四

阿里全面开放世界模型 HappyOyster 快乐生蚝 1.0

阿里云上线可实时交互的开放式世界模型产品 HappyOyster 1.0(快乐生蚝 1.0),用户一句话可生成完整、可探索、可互动的数字世界。产品基于原生多模态架构,支持多模态输入与音视频联合生成,区别于传统一次性渲染流程,可在生成过程中持续接收用户指令并实时响应。

演语科技(EVOKEN)完成近 3 亿美元B+轮融资

演语科技(EVOKEN)完成近3亿美元B+轮融资,投后估值超20亿美元,由Granite Asia、顺为资本联合领投,高榕创投、蚂蚁集团等股东持续加码。旗下产品矩阵覆盖LibLibAI、LibTV及星流三大平台,其中AI视频平台LibTV上线两月收入增超13倍,5月集团整体收入同比增长超3000%。本轮资金将用于加大研发投入与全球市场拓展。

DeepSeek 识图模式全量上线 App 和网页端

DeepSeek多模态研究员Xiaokang Chen宣布,DeepSeek识图模式已在网页端和App端正式上线。该模式与快速模式、专家模式并列,开启后,用户可直接上传图片让DeepSeek进行深度理解,能力边界远超简单的文字提取。

豆包实时语音模型3.0 API 服务正式上线

火山引擎正式上线豆包实时语音模型 3.0(Seeduplex)API 服务并开启邀测。作为原生全双工端到端语音大模型,模型具备精准遵循、抗干扰、动态判停三大优势,支持在实时对话中调用工具完成任务,实现边听边说边办事。判停延迟缩短约 250ms,复杂场景抢话比例下降 40%。

OpenAI 为 ChatGPT 推出全新定时任务功能

OpenAI 为ChatGPT逐步推送全新定时任务功能,替代现有的Pulse功能。新功能支持发送提醒、处理周期性工作及监测事项,新增侧边栏专属页面统一管理任务,运行速度与稳定性均获提升。用户可指定精确时间或宽泛时段,监测类任务支持联网检索与应用数据读取。新功能每小时最多运行一次,长时间无交互可能自动暂停。

6月17·周三

SpaceX 600亿美元收购 Cursor

SpaceX宣布以全股权交易600亿美元收购AI编程工具Cursor母公司Anysphere,Cursor将成为SpaceX全资子公司,预计2026年Q3完成交割。SpaceX刚完成纳斯达克上市,市值达2.5万亿美元。Cursor年度B2B收入约26亿美元,此前底层模型依赖Anthropic和OpenAI,面临断供风险;并入后可用xAI超算训练自有代码模型。

DeepSeek首次融资落地,募集超500亿,估值超3300亿元

DeepSeek 完成首次对外融资,募资超 500 亿元(约 74 亿美元),估值超 500 亿美元(约 3380 亿元),创国内 AI 行业最大单笔融资纪录。交易结构特殊:资金需投入梁文锋管理的有限合伙企业,外部投资者股份锁定五年且无投票权;国家 AI 产业投资基金例外,直接投资 10 亿元。梁文锋个人出资 200 亿元,腾讯、宁德时代等参投。

智谱上线并开源 GLM-5.2 ,专注Coding与长程任务

智谱科技上线并开源 GLM-5.2 模型,在 Code Arena 前端评估中位列全球可用模型第一。模型专为长程任务设计,支持 1M 无损上下文,在 FrontierSWE 等基准上表现接近 Claude Opus 4.8。GLM-5.2 引入 effort level 控制,通过 IndexShare 架构优化降低 FLOPs,原生适配华为昇腾等国产算力。

Xiaomi MiMo Claw 正式版上线,旗舰模型联动金山办公

小米推出Xiaomi MiMo Claw正式版,搭载MiMo-V2.5-Pro旗舰模型,原生适配OpenClaw框架与MCP协议,支持百万级超长上下文。联动金山办公生态,实现Word、Excel、PPT、PDF全链路文档生成与编辑闭环。产品采用云端免部署架构,提供7×24小时专属Agent服务。

微信支付 「AI 专属卡」上线

微信支付正式推出AI专属卡,WorkBuddy率先接入。用户只需一句话,AI可代为查找餐厅、领取优惠券、团购下单并完成支付。资金安全采用专款专用+笔笔确认机制,每笔支付需用户手机端亲自授权。目前仅支持WorkBuddy mac电脑版5.1.1及以上版本,用户可在专家页面召唤美团生活助手体验。

6月16·周二

MiniMax 开源原生多模态旗舰模型 MiniMax M3

MiniMax 开源原生多模态旗舰模型 MiniMax M3,总参数 428B、激活参数 23B,采用自研 MSA 稀疏注意力架构降低长上下文计算成本,是首个从 Step 0 开始多模态混合训练的开源模型。发布后在 Artificial Analysis 综合智能指数、GDPval-AA、Code Arena WebDev 等多个榜单取得开源模型第一,获 Vercel CEO 及 YC 创始人等业

蚂蚁支付宝推出超级生活 AI 助手「AI版支付宝」

支付宝推出AI版支付宝,用户右滑可进入清爽对话界面,用语音或文字指令办理政务、出行、生活等上万项服务,实现对话即服务。涉及资金变动需用户本人确认,保障安全。AI版已开启邀测,与经典版可自由切换,平台同步开放服务生态,面向10亿用户推进普惠AI。

硅基流动完成新一轮超 20 亿元融资

硅基流动近日完成超20亿元B轮融资,由携程、晶科能源、金蝶、联通、壁仞、蔚来、商汤、巨人网络、国泰君安、纪源资本等产业链头部企业与知名机构联合投资,华兴资本担任独家财务顾问。公司定位”Token工厂”模式,日均Token调用量达数万亿,服务超1000万用户及1万家企业客户,营收同比增长超10倍。

阿里通义推出物理世界基础模型套件 Qwen-Robot Suite

阿里通义推出 Qwen-Robot Suite 机器人基础模型套件,包含 RobotNav(导航)、RobotManip(操作)与 RobotWorld(世界预测)三大模型,通过语言优先接口将视觉语言模型与物理动作对齐。套件在导航、操作、世界模型等10余项基准上达到SOTA。

即梦上线视频生成模型 Seedance2.0 mini

即梦AI上线Seedance 2.0 Mini视频生成模型,主打极致性价比,720P单秒生成成本低至0.16元,用更低价格实现相同生成效果。模型面向广大创作者开放,用户可前往即梦网页端抢先体验首发价,享受高性价比的AI视频创作服务。

火山方舟体验中心上线视频生成模型 Seedance 2.0 mini

火山引擎旗下火山方舟体验中心上线Seedance 2.0 mini视频生成模型,并将于近期开放API服务。模型定位高性价比,面向广泛视频创作与规模化生产需求。图生视频定价0.023元/千tokens,视频生视频0.014元/千tokens;按720P规格折算,单秒生成成本约0.5元,相较Seedance 2.0成本降低约50%。

6月15·周一

智谱AI推出最新旗舰开源模型 GLM-5.2

智谱推出GLM-5.2模型,支持1M上下文,模型长程任务领先,定位最强国产Coding模型。GLM-5.2 将面向 GLM Coding Plan 全量用户开放,覆盖 Lite / Pro / Max / 团队版。GLM-5.2 API 本周将上线,同时模型也将开源,遵循 MIT 协议。

Kimi K2.7 Code 高速版上线 Kimi API 开放平台

Kimi K2.7 Code 高速版,模型ID:kimi-k2.7-code-highspeed已上线 Kimi API 开放平台,输出速度达普通版 5-6 倍,定价为普通版 2 倍。K2.7 Code 相比 K2.6 在长上下文编程、token 效率上显著提升,平均 token 消耗减少 30%,基准测试性能提升 11%-31.5%。

大晓机器人完成天使+轮融资,已累计融资数亿美元

大晓机器人完成天使+轮融资,上半年累计融资数亿美元,达晨财智、深创投等参投。资金将投入世界模型及软硬一体解决方案。开悟世界模型3.0为全球首个开源量产世界模型,多项权威评测第一,支持7分钟长时序视频生成,已实现端侧部署。

OpenRouter 推出 Fusion 多模型智能融合服务

OpenRouter 上线 Fusion 服务,通过多模型并行作答与裁判模型融合,实现高性价比智能输出。DRACO 基准显示,Gemini 3 Flash、Kimi K2.6 与 DeepSeek V4 Pro 的预算组合以半价取得 64.7% 得分,逼近 Claude Fable 5 的 65.3%。该机制具备单模型故障自动替补的鲁棒性,支持 API 直接调用与自定义模型组合。

百度飞桨 PaddleOCR 开源第六代 OCR 模型 PP-OCRv6

百度飞桨正式推出PP-OCRv6,首次推出Tiny/Small/Medium三档模型。模型检测与识别精度较v5提升4.9%和5.1%,CPU推理速度最高达前代5.2倍。模型支持50种语言,新增电路板、数码管等工业场景,鲁棒性史上最高。模型现已上线官网并开源至GitHub和HuggingFace。

6月12·周五

月之暗面开源新一代编程专用模型 Kimi K2.7 Code

月之暗面开源Kimi K2.7 Code编程模型,相比K2.6在长上下文编程、指令遵循及Agent自主执行能力上显著提升,代码基准测试提升11%-31.5%,token消耗减少30%,API定价与K2.6持平。模型须开启思考模式发挥最佳性能。

AI Agent 创作工作台 MiniMax Hub 正式上线

MiniMax推出的桌面端多模态创意Agent平台MiniMax Hub正式上线。平台将文案、图像、视频、音频等多模态Agent整合到同一画布上,支持多Agent并行工作流,实现从创意构思到成片输出的一站式创作。用户只需输入创意简报,平台可自动调度各Agent协同完成内容生产,涵盖营销短片生成、长视频拆条、品牌物料批量出图等场景。

OpenAI 收购初创公司 Ona

OpenAI 宣布收购初创公司 Ona,为编程助手 Codex 提供安全、预配置云环境。Ona 技术将帮助 Codex 执行更长时间任务,支持用户将 AI 智能体安全部署到生产环境,同时强化企业对基础设施、数据资产和安全边界的掌控。双方未公布交易金额,Ona 团队将加入 OpenAI 参与 Codex 项目研发。

Hermes Agent 上线 Profile Builder,5 步配置 AI 智能体

Nous Research 为 Hermes Agent 推出 Profile Builder,将原本分散的命令行配置整合为网页端一站式可视化流程。用户通过5步可完成智能体角色创建:设定身份名称与描述、选择模型与服务商、配置内置技能、安装 Skills Hub 技能、接入 MCP 服务器,最后预览确认。

Visa 与 OpenAI 达成合作,探索 AI 智能体交易新模式

Visa 宣布与 OpenAI 达成战略合作,双方将推动智能体商业进入市场,探索 AI 智能体交易新模式。Visa 将把全球支付网络、支付标记化、授权机制、身份识别及欺诈检测技术引入 OpenAI 产品,确保 AI 发起的交易安全可控,最终决策权仍保留在用户手中。同时双方将探索把支付能力整合到开发者工具中。

6月11·周四

小米开源终端 AI 编程助手 MiMo Code

小米大模型团队开源终端AI编程助手 MiMo Code ,内置限时免费的 MiMo-V2.5 模型,同时支持 DeepSeek、Kimi 等主流模型。核心特性包括独创持久记忆系统、Compose 模式实现全流程自动开发、/dream 命令定期整理记忆,以及语音输入控制。在 SWE-Bench Pro 和 Terminal Bench 2 基准上,相同模型下表现优于 Claude Code。

智象未来推出商用图像生成模型 HiDream-O1-Image-1.5

智象未来推出商用图像生成模型 HiDream-O1-Image-1.5,在 Artificial Analysis 文生图榜单上以 1265 ELO 位列全球第三、中国第一,仅次于 OpenAI 的 GPT Image 系列,超越 Google、NVIDIA 及字节跳动等主流模型。模型基于原生全模态架构 UiT,在语义遵循、文字渲染、复杂排版及多主体一致性上表现突出。

阿里秒悟Meoo推出开源命令行工具 Meoo CLI

阿里秒悟Meoo开源命令行工具Meoo CLI,帮助本地AI编程项目一键部署上线。安装后,Claude Code、Codex、Cursor等本地Agent可通过自然语言调用云端能力,自动完成数据库接入、用户登录、文件存储、AI模型调用及项目发布,10分钟内将本地Demo变为可访问的线上应用。

科大讯飞推出智慧空间Agentic架构 SpaceMind

科大讯飞推出智慧空间Agentic架构SpaceMind,推动智能家居从被动响应进入L2.5主动智能时代。SpaceMind用毫米波雷达为核心感知源,实现5厘米级定位与呼吸级微动检测;采用双路由架构与本地语义模型+云端大模型协同,设备控制响应低至700毫秒。系统具备持久记忆、多Agent协作和主动服务能力,可基于用户习惯自动调节环境。

AI短剧协作平台 AniShort 完成近亿元融资

专注数字人与AIGC视频生成的八点八数字公司宣布,旗下AI短剧协作平台AniShort完成近亿元融资,由北京泰中合领投。本轮资金将重点用于技术研发与创作者生态建设。平台通过打通短剧创作全流程,解决行业制作成本高、周期长等痛点。

GUI Agent平台Core-Mate获数千万元融资

GUI Agent 执行平台 Core-Mate 完成数千万元融资,由敦鸿资产独家投资。团队核心成员来自字节跳动,曾在抖音、豆包担任产品经理。Core-Mate 让 AI 真正接手网页和 App 中的真实操作,通过开源的 OpenGUI 框架融合视觉、控件树与页面状态实现稳定屏幕语义理解。

6月10·周三

Anthropic推出最强 AI 模型 Claude Fable 5/ Mythos 5

Anthropic推出Claude最强模型Claude Fable 5,性能全面超越前代,在SWE-Bench Pro等基准大幅领先。模型可在1天内完成5000万行代码库迁移,且Token效率更高。Anthropic同时推出无护栏版Claude Mythos 5,仅向Glasswing合作伙伴开放。Claude Fable 5设有安全护栏,敏感请求降级至Claude Opus 4.8。

字节跳动 TRAE SOLO 升级为 TRAE Work

字节跳动旗下 TRAE 宣布 TRAE SOLO 正式升级为 TRAE Work,品牌内涵从The Real AI Engineer拓展为The Real AI Enabler。TRAE Work 面向更广泛的真实工作场景,包含 Work 模式与 Code 模式。TRAE Work 已覆盖 PC、移动端和 Web 三端,支持多任务并行,并于5月完成与飞书打通。

蚂蚁集团推出 AI 应用生成平台 QMuse

蚂蚁集团推出AI应用生成平台QMuse,用户通过一句话自然语言描述可零代码生成可运行应用。平台内置灵感橱窗辅助创意,依托支付宝账号体系保障安全。目前产品处于内测阶段,需邀请码使用,旨在大幅降低应用开发门槛,实现从创意到产物的极速跨越。

谷歌推出实时翻译模型 Gemini 3.5 Live Translate

谷歌正式推出实时语音互译模型 Gemini 3.5 Live Translate,可自动识别 70 余种语言,生成保留原说话者语调、语速和音高的流畅翻译语音。模型在等待上下文与即时翻译间取得平衡,仅比说话者慢几秒。模型已面向开发者开放 Gemini Live API 预览,企业用户可在 Google Meet 中使用,普通用户可通过谷歌翻译 App 体验。

阿里千问推出国内首个全周期高考志愿填报Agent

阿里千问上线国内首个全周期高考志愿填报Agent,为全国考生免费提供志愿填报服务。产品基于千问高考志愿大模型和夸克8年高考数据,具备志愿日历、志愿报告和志愿问答三大能力。志愿报告实现Agent化升级,支持细节需求捕捉与实时动态调整。

6月9·周二

高德推出首个3D原生城市世界模型ABot-Earth 0.5

高德地图推出ABot-Earth 0.5,首个3D原生城市世界模型。模型支持图像、文本等多模态输入,可在消费级单卡GPU上10分钟内生成1平方公里高保真3D城市场景。模型基于3D Gaussian Splatting表示,采用原生LoD解码器和滑窗无缝推理策略,覆盖全球190余个国家和地区、300余城市。

小米推出 MiMo-V2.5-Pro UltraSpeed 模式

小米联合TileRT推出MiMo-V2.5-Pro UltraSpeed模式,在通用GPU上实现万亿参数模型生成速度首次突破1000 tokens/s。该模式定价为普通版的3倍,输出速度提升约10倍,仅支持API体验。MiMo-V2.5-Pro UltraSpeed模式采用申请制限时开放,优先审核企业与专业开发者。

AI 短剧创作「井英科技」宣布完成数千万美元 A 轮及 A+ 轮融资

井英科技(CreativeFitting)完成数千万美元A轮及A+轮融资,投资方包括王慧文家办、蚂蚁集团等,同时宣布原AWS首席应用科学家王敏捷加盟任首席科学家。公司定位为内容行业首家Agent原生公司,以AI短剧为首个场景,构建创作者Agent可接入、可自我进化的强化学习环境,通过真实消费反馈驱动迭代。

6月8·周一

OpenAI为所有个人用户开放ChatGPT锁定模式

OpenAI宣布向所有ChatGPT个人用户(Free、Go、Plus、Pro)开放锁定模式。功能启动后能禁用实时网页浏览、深度研究、Agent模式、图片检索及文件下载等高风险联网功能,仅支持访问缓存内容,同时保留图片上传与生成功能。

大晓机器人推出全屋三维可交互世界模型 Kairos-HomeWorld

大晓机器人联合香港中文大学、深圳河套学院推出全球首个全屋三维可交互世界模型Kairos-HomeWorld。模型采用四阶段分层生成架构,可从文本指令一键生成结构连贯、物理合理、功能完整的全屋三维场景,每个场景平均包含超15个可交互物体,支持机器人完成跨房间导航、物品整理等复杂家务仿真训练。

谷歌和 SpaceX 公司达成9.2亿美元云计算合作

谷歌与SpaceX达成云计算合作,自2026年10月至2029年6月,谷歌每月向SpaceX支付9.2亿美元(约62.46亿元人民币),租赁约11万张英伟达GPU、CPU等芯片算力,用于AI训练与推理。协议将缓解谷歌算力供应紧张,同时为SpaceX AI业务开辟重要收入来源,为其IPO增添新叙事筹码。

「华超神控」获亿元天使系列融资

新一代AI超声脑机公司华超神控(BCI-Sonics)宣布完成亿元人民币级天使轮系列融资,天使轮由经纬创投领投,天使+轮由德联资本、道远资本联合领投。公司由中科院博士、前GE医疗中国区负责人李昕创立,专注低强度聚焦超声无创脑机接口技术。本轮资金将用于技术验证与产业化落地,推进疼痛、成瘾等适应症临床转化。

6月5·周五

ChatGPT 推出全新的 Dreaming 记忆系统

OpenAI推出基于Dreaming技术的新版ChatGPT记忆系统。系统能自动整理长期对话中的用户偏好、计划等背景信息,判断信息是否过时,实现记忆的自动更新与修正,使回答更个性化。同时新功能新增可查看、编辑的记忆摘要。本次更新率先面向美国Plus和Pro用户开放,未来将逐步扩展至更多地区及免费用户。

腾讯推出企业级AI智能工作台WorkBuddy企业版

腾讯推出企业级AI智能工作台WorkBuddy企业版,面向AI原生组织转型提供7×24小时数字员工、人机协同项目模式及企业管理后台,原生接入腾讯文档、网盘与乐享,支持公有云、VPC专享及私有化部署。通过沉淀团队记忆与AI资产,将个人提效升级为组织提效。

阿里通义推出通用智能体评测基准 PawBench

通义实验室推出通用智能体评测基准PawBench,首次将底座模型与运行框架(Harness)纳入联合评测。PawBench v1.0 包含 150 道真实任务、4050 个测试单元,覆盖 9 个模型与 3 个 Harness 的交叉矩阵。评测发现 Harness 性能差距最高达 6.4 分,同一模型换 Harness 分差可达 11.5 分。

谷歌推出本地实时 AI 音乐模型 Magenta RealTime 2

谷歌Magenta团队推出Magenta RealTime 2(MRT2)本地实时音乐AI模型,包含2.4B高质量版与230M高速版,均针对Apple Silicon优化。模型采用逐帧生成架构,将延迟从3秒降至约200毫秒,支持文本、MIDI及音频风格控制。同步推出免费乐器应用Jam与DAW插件,可在Mac端实现低延迟即兴合奏。

6月4·周四

AI音乐公司 Suno 获4亿美元融资

AI音乐独角兽Suno完成4亿美元融资,估值翻倍至54亿美元,由Bond Capital领投,IVP等跟投。公司订阅用户已突破200万,年销售额有望达3亿美元,计划年底扩招70%员工。Suno已与华纳音乐达成和解并签署授权协议,此前仍面临环球、索尼、华纳三大唱片公司的版权侵权诉讼。

月之暗面推出通用型本地 Agent「Kimi Work」Beta版

月之暗面推出面向知识工作者的通用型本地Agent 「Kimi Work」 Beta版,随Kimi最新测试版Mac和Windows客户端发布。其内核为Kimi Code,支持安装Skills、运行定时任务,内置Kimi WebBridge浏览器操作能力,可自主创建最多300个子Agent的集群协作。Beta版支持金融分析、科研数据清洗、办公报告生成等场景,目前开放内测。

京东开源长音视频生成框架 JoyAI-Echo

京东推出 JoyAI-Echo 长音视频生成框架,通过跨模态音视频记忆库、记忆驱动后训练推理速度提升7.5倍、Director Agent对话式编辑及轻量化实时超分四项技术创新,解决角色一致性、声音稳定性和生成速度三大行业难题。实测显示框架5分钟视频角色与音色高度一致,语音准确率达0.8646,各项指标全面领先。

Nous Research 推出 Hermes 官方桌面端 Hermes Desktop

Nous Research 推出 Hermes 官方桌面客户端(预览),支持 macOS、Windows 和 Linux 三端。工具具备持久记忆、任务调度、子代理委派、网页浏览、多模态推理及隔离沙箱等核心能力,可直接在本地桌面运行,彻底告别终端命令行。Hermes Desktop终结了用户长期依赖终端或第三方UI的历史,标志Hermes向更友好的桌面端AI Agent形态演进。

6月3·周三

OpenAI 发布 AI 编程智能体 Codex 三项更新

OpenAI宣布编程智能体Codex三项更新:智能体插件预置6个岗位技能包,企业无需编程可部署AI员工;注释功能支持对生成内容指哪改哪精准修改;站点功能可将文档一键转为交互式网站。Codex周活跃用户已达500万,较年初增长8倍。同时OpenAI计划将Codex引入ChatGPT,支持AWS平台一键部署。

Windsurf 升级更名为 Devin Desktop

Cognition 宣布 Windsurf 正式升级为 Devin Desktop,从 AI IDE 转型为 Agent 指挥中心。新版本引入 Kanban 统一管理本地与云端 Agent,新增 Spaces 实现跨 Agent 上下文共享,支持 ACP 开放协议接入 Codex、Claude Agent 等第三方 Agent。产品保留完整 IDE 能力,现有用户可通过 OTA 自动升级,实现零成

微软推出七款全新 MAI 模型

微软推出全新自研 MAI 模型,包括 MAI-Thinking-1推理模型、MAI-Image-2.5图像模型、MAI-Image-2.5-Flash高效版图像模型、MAI-Voice-2语音模型、MAI-Voice-2-Flash高效版语音模型、MAI-Transcribe-1.5语音转文本模型、及MAI-Code-1-Flash编码模型。所有模型均从零训练,无蒸馏,共享统一数据规范与评估框架。

千问App向第三方Agent、Skill全面开放

千问App宣布向第三方Agent和Skill全面开放,所有企业均可在千问运营品牌Agent。肯德基、瑞幸、蜜雪冰城、东方航空等首批企业正在测试,将陆续上线。Agent具备记忆与主动规划能力,可主动提供行程提醒、权益到期、复购推荐等服务。

字节跳动开源统一视频生成与编辑框架 Bernini

字节跳动开源 Bernini 统一视频生成与编辑框架。框架创新性地引入多模态大模型作为规划师,模型能理解用户意图与语义目标,再交由扩散模型进行高质量视觉渲染,大幅提升AI视频编辑的可控性。

6月2·周二

阿里通义推出多模态智能体基座模型 Qwen3.7-Plus

阿里推出Qwen3.7-Plus多模态模型。模型将视觉与语言统一为智能体基座,能感知场景、操作GUI、生成代码并执行任务。模型具备多模态推理、视觉编程和浏览器自动化等能力,可完成APP全链路开发等复杂工作流。在全球权威视觉榜单Vision Arena中,阿里凭借模型跻身全球前五、中国第一。

北大团队全新升级 ChatExcel Max 2.0

北大团队发布ChatExcel Max 2.0。新版本彻底解除文件大小、数量限制,100%保留原Excel公式与格式。通过对话即可完成复杂数据处理,一键生成Word、PPT、可视化看板等专业报告。应用于财务审计、物流、人力等场景,实现跨表核对、异常标记与全流程自动化分析,保障企业级数据安全。

阿里达摩院推出 AI 原生开发平台「语构」

阿里达摩院推出AI原生开发平台「语构」,以Vibe Coding为核心范式,用户通过自然语言描述可生成完整可用的数字产品。平台覆盖需求理解、智能追问、自动开发到预览发布的全链路,内置大模型对话、文生图、机器翻译、地图检索、实时汇率、股价查询、气象数据等标准化资源接口,支持零代码调用。

谷歌母公司 Alphabet 宣布 800 亿美元大额融资,用于 AI 支出

谷歌母公司Alphabet宣布总额800亿美元股权融资,用于AI基础设施与算力建设。其中300亿美元为公开发行,400亿美元按市值发行,伯克希尔·哈撒韦私募投资100亿美元。公司此前预计2026年资本支出达1800至1900亿美元,2027年将进一步提升;云业务2026年Q1营收同比增长63%,积压订单逾4600亿美元。

词元无限完成数千万元融资

词元无限完成数千万元天使+轮融资,由华控基金、水木创投联合领投,厦金创新跟投。公司由字节跳动万人级研发体系AI化改造团队与清华姚班背景团队创立,定位为企业级Agent基础设施,核心产品InfCode与InfOne分别面向AI原生软件开发和组织级智能业务编排,已服务十余家头部金融与软件企业。

6月1·周一

扣子 3.0 正式上线

扣子 3.0 正式上线,实现 iOS、Android、Mac、Windows 及网页端全量更新。新版本定位新一代 AI 团队,核心升级多 Agent 协作与项目空间管理,用户可创建项目召集不同职能 Agent 与团队推进任务。同时支持接入 Claude Code、Codex CLI 等本地 Agent,提供云端 Agent 长期运行能力,平台内置投资顾问、自媒体达人等职业模板。

MiniMax 开源新一代 AI 模型 MiniMax M3

MiniMax技推出MiniMax M3,国内首个同时具备前沿编程能力、1M超长上下文和原生多模态能力的开源模型。在SWE-Bench Pro等国际权威评测中,M3多项指标超越GPT-5.5等海外模型,接近Opus 4.7领先水平。模型采用全新的MSA稀疏注意力架构,支持100万token上下文窗口,显著提升处理效率。

响指HaiSnap APP正式上线

响指HaiSnap APP正式上线,产品定位为移动端AI创作Agent平台。用户可通过语音、文本或上传文件发起任务,AI自动执行并生成网页应用、文档、PPT、图片等可发布成果。核心功能包括智能体工作区、我的成果库、任务回放及技能调用。

VAST 获近2亿美元 A 轮系列融资

通用人工智能公司VAST完成A+及A++两轮近2亿美元融资,由渶策资本、国寿长三角科创基金领投,荣耀等产业方及多家一线财务资本联合投资。同时,VAST推出全新世界模型项目Project Eden,创新性地将底层状态推演与视觉呈现解耦,解锁环境长程持久、场景自由复用、多人并发交互等颠覆性能力。

小米开源可控视频音效生成模型 ControlFoley

小米大模型应用团队开源可控视频音效生成模型 ControlFoley,统一支持文本引导视频配音、文本控制视频配音及参考音频控制视频配音三类任务。模型通过联合视觉编码、时间-音色解耦与模态鲁棒训练,解决现有方案文本控制弱、参考音频难同步等问题,在 VGGSound-Test 等多个 benchmark 上达到开源 SOTA 表现。

阿里通义推出通用具身智能统一动作框架 Qwen-VLA

通义实验室推出Qwen-VLA,以Qwen3.5-4B为底座搭配DiT动作解码器,通过统一动作轨迹预测框架、本体感知提示条件化及文本到动作预训练(T2A)技术,将操作、导航与轨迹预测整合为单一通用具身模型。模型在多项基准测试中超越专用模型,支持11种机器人平台跨本体控制。

5月29·周五

Anthropic 融资 650 亿美元,融资后估值达9650亿美元

Anthropic完成650亿美元H轮融资,投后估值达9650亿美元(约6.56万亿元人民币),预计为IPO前最后一轮私募融资。本轮由Altimeter Capital、Sequoia Capital等机构领投,亚马逊等超大规模云提供商参与,其中亚马逊已宣布投资50亿美元。

Anthropic 推出旗舰级大语言模型 Claude Opus 4.8

Anthropic 推出 Claude 旗舰模型 Claude Opus 4.8。模型在终端工程、知识工作等能力大幅提升,部分指标超越未发布的 Mythos。核心改进是诚实性:代码缺陷漏报率降至前代 1/4,过度自信行为概率降至 1/10。Cursor 和 Devin CEO 均给予高度评价。

通义千问推出文生图模型评测基准 Qwen-Image-Bench

通义实验室推出文生图评测基准 Qwen-Image-Bench,包含 56 个细粒度创作考点,配套开源自动化评估模型 Q-Judger。基准由专业艺术家团队参与开发,覆盖世界知识、创作推理、文字渲染、影像叙事、游戏设计等真实创作场景,填补基础生成与专业创作之间的评测鸿沟。

AstronClaw 上线 Agent Team 模式

AstronClaw正式上线Agent Team模式,用户一句指令可自动组建多专业Agent团队,通过流水线、映射归约、监督者三种协作模式并行完成复杂任务的全流程拆解与高质量交付。Agent Team模式配备可视化任务看板,支持GLM 5.1、Kimi 2.6等模型底座,可将传统需数周的产品规划、营销方案等任务压缩至半小时内完成。

阿里云开源 AI Agent 命令行工具「阿里云百炼 CLI」

阿里云百炼 CLI 正式开源,开发者仅需一行命令可让 AI Agent 自动接入阿里云百炼平台 150 余款模型、十多款应用,以及知识库、记忆、联网搜索等全套能力。阿里云百炼 CLI 专为 Agent 场景设计,支持文本、图像、视频、语音等多模态调用,原生兼容 Claude Code、Qoder、OpenClaw 等主流 Agent 框架。

清华联合面壁智能开源 Agent 操作系统 PilotDeck

面壁智能联合清华THUNLP、OpenBMB等开源智能体操作系统 PilotDeck,用工作舱取代传统对话框,解决 Agent 记忆黑盒、成本失控、任务被动等痛点。系统支持记忆白盒化、智能路由(成本降70%+)及24小时 Always-on 主动运行,实现多项目并行与端云协同。

零一万物三周年宣布做首家盈利的 AI 2.0 公司

零一万物三周年之际,李开复发表内部致辞《三生万物》,宣布公司开启”二次创业”,从AGI理想转向产业AI落地。公司对标Palantir,聚焦高毛利、高复购的2B业务,目标明年某季度成为中国首家盈利的AI 2.0公司。同时推出合伙人制度、2000万股期权及CEO专项激励,引入DRI范式。

5月28·周四

腾讯推出AI游戏创作平台「代号Craft」

腾讯推出AI游戏创作平台「代号Craft」,支持赛车、开放世界、RPG、卡牌等多种游戏类型,提供2D/3D海量免费资产库与AIGC能力,让做游戏像玩游戏一样简单。平台联合深圳前海启动”开发者先锋营”线下训练营,为首测开发者提供AI游戏创作学习与实践机会,目前正在招募首批测试用户。

Runway 推出 Runway MCP 服务器

Runway推出 Runway MCP 服务器,将旗下AI视频与图像生成能力接入Claude、ChatGPT、Cursor等兼容Agent。用户无需切换上下文,可在对话中直接调用Gen-4.5、Seedance 2.0、GPT Image 2等模型生成营销视频、产品素材及视觉内容。

OpenRouter 完成1.13亿美元 Series B 融资

OpenRouter 宣布完成1.13亿美元 Series B 融资,由 Alphabet 旗下独立成长基金 CapitalG 领投,NVentures、ServiceNow Ventures、MongoDB Ventures 等参投。平台周处理量达 25 万亿 tokens,较半年前增长 5 倍,月处理量达 100 万亿。本轮融资将用于扩展路由、治理和优化能力,支持企业多模型 AI 部署需求。

自变量机器人开源具身智能模型 Wall-OSS-0.5

自变量机器人(X Square Robot)开源具身大模型 Wall-OSS-0.5,提出预训练即可部署,在17个真实机器人任务零样本测试中,4项得分超80分。模型基于20余种机器人形态、超百万条轨迹及9000万条多模态语料预训练,采用梯度桥接协同训练与视觉对齐动作Tokenizer,微调后任务进度领先行业标杆π0.5达17.5分。

微软推出最强 AI 生图模型 MAI-Image-2.5

微软研究院推出最强图像生成模型MAI-Image-2.5,在Arena文生图榜单升至第3名,打破此前前5名仅由Google DeepMind和OpenAI占据的局面,较前代提升72分。模型重点增强文字渲染能力,可胜任信息图、海报等商业物料生成,同时在视觉推理、画面细节和风格一致性上显著进步。

5月27·周三

支付宝推出全球首个Token Pay服务

支付宝发布全栈AI原生支付体系,推出全球首个Token Pay服务、AI钱包,连同此前落地的AI付与AI收,构成覆盖授权、支付、结算、管理的完整智能体经济基础设施。AI付已完成3亿笔智能体支付,支持95%主流智能体框架,资损率降至亿分之一;AI收让全网Agent可自动购买商家服务,个人经验可通过Agent便捷变现。

小米宣布 MiMo-V2.5 系列 API 永久降价

小米大模型MiMo-V2.5系列宣布API永久降价,最高降幅达99%,Token Plan套餐用量提升至原5-8倍。同时,自4月28日启动的”百万亿Token创造者激励计划”提前收官,累计发放100万亿Token,申请人数超54.8万。现有Token Plan用户额度全量重置,V2.5-TTS系列继续限时免费。

快手开源自研多模态大模型 Keye-VL-2.0-30B-A3B

快手正式开源多模态大模型 Keye-VL-2.0-30B-A3B,首次将 DSA 稀疏注意力机制引入多模态理解场景,支持 256K 超长上下文,实现长视频时序因果推理。模型在 TimeLens 视频理解基准中部分指标超越 Gemini 2.5 Pro 与 Gemini 3 Flash,首次解锁 Agent 协作能力,覆盖代码、工具调用与搜索等复杂任务场景。

5月26·周二

天工AI推出高性能 Agent 模型 SkyClaw-v1.0

昆仑万维旗下天工AI正式推出高性能Agent模型SkyClaw-v1.0及轻量化版本SkyClaw-v1.0-lite。模型支持百万token长上下文,深度适配真实智能体工作流,重点优化复杂工具调用、多轮任务执行、代码生成与交互式应用构建。在多项Agent基准测试中,SkyClaw-v1.0全面超越Minimax 2.7、DeepSeek V4 Flash等主流开源模型,性能接近更大规模的顶级模型

小米推出全新世界模型Xiaomi Auto World Model

小米汽车正式发布Xiaomi Auto World Model全新框架,首次将三维重建与视频生成深度耦合为一体化架构。框架重建模块以稀疏三维锚点替代传统稠密高斯,10秒视频仅需10秒完成;生成模块通过两阶段训练与ODE蒸馏实现4步去噪、0.19秒/帧的高效生成,支持最长1分钟视频。

阿里通义开源多智能体开发框架 AgentScope 2.0

阿里通义实验室推出AgentScope 2.0,聚焦真实场景下的稳定运行与生产接入进行系统性升级。新版本新增模型容错机制,支持失败自动重试与备用模型切换;重构消息模块实现执行过程实时可见;引入权限系统对高危操作自动拦截;优化上下文管理避免长链路失忆。

面壁智能联合清华等开源端侧文本基座大模型 MiniCPM5-1B

面壁智能联合清华大学、OpenBMB开源社区正式开源端侧文本基座大模型MiniCPM5-1B。模型以1B参数规模在AA-Index榜单得分17.9,超越所有2B以下模型,甚至超过参数翻倍的主流基座模型,成为全球2B参数以内最强开源基座模型。INT4量化后仅0.5GB,可在手机、浏览器等终端流畅运行。

5月25·周一

面壁智能联合清华开源端侧大模型 BitCPM-CANN

面壁智能联合清华大学及 OpenBMB 开源社区开源中国首个完全基于华为昇腾国产算力平台端到端训练的 1.58-bit 三值大模型 BitCPM-CANN,包含 0.5B 至 8B 四个尺寸。模型采用量化感知训练路线,推理阶段释放约 6 倍显存红利,模型能力保留率达 90%–97.2%,为端侧 AI 落地与国产 NPU 生态提供关键基础设施。

商汤办公小浣熊推出桌面智能体

商汤办公小浣熊桌面智能体正式发布,定位从建议者进化为执行者的AI办公伙伴。产品具备六大核心能力:支持20+格式本地文件直读、浏览器自动化、Ctrl+K全局快捷唤起、飞书等办公协同、本地记忆越用越懂用户、定时任务自动执行。

腾讯全面开放 ima copilot

腾讯ima copilot宣布全面开放,用户无需排队即可使用。工具具备持续进化记忆与全场景感知能力,可读取、总结并调用知识库内容,支持接入各大模型API KEY及自定义扩展技能。同时,ima知识号新增发布Skill功能,知识广场从”内容平台”升级为”能力平台”,首批上线微信读书、腾讯招聘等官方Skill。

DeepSeek-V4-Pro API永久降价为原定价的 1/4

DeepSeek官方宣布 DeepSeek-V4-Pro 模型API永久降价,5月31日结束2.5折优惠活动后,正式调整为原定价的1/4。降价后,缓存命中输入0.025元/百万Tokens,缓存未命中输入3元/百万Tokens,输出6元/百万Tokens。这意味着原本的限时2.5折优惠将永久保持,大幅降低开发者使用成本。

智谱清言上线 AgentMore Skills 广场

AgentMore Skills广场正式上线。广场整合「推荐」官方严选、「Skillhub」7.4 万+免费技能及「开源社区」三大模块,支持全局搜索与一键零 Token 安装。用户可为 Agent 快速装备微信读书、美团优惠券等大厂独家技能包,实现从通用聊天到行业专家的秒级升级,支持随时卸载管理。

5月22·周五

智谱推出GLM-5.1高速版API,GLM-5.1-highspeed

智谱开放平台发布GLM-5.1高速版API GLM-5.1-highspeed,模型输出速度达400 tokens/s,刷新全球大模型API速度上限。GLM-5.1-highspeed由智谱与TileRT团队联合推出,首次在国产大模型中实现旗舰级能力与极致低延迟兼得。适用AI编程、实时交互、实时语音等对延迟要求极高的场景,现已面向部分企业客户开放。

美团开源数字人视频模型 LongCat-Video-Avatar 1.5

美团LongCat团队正式开源LongCat-Video-Avatar 1.5数字人视频模型,从开源SOTA迈向商业级应用。模型升级Whisper-large音频编码器,构建高质量多场景数据体系,引入逐帧级GRPO偏好对齐,在唇形同步、物理合理性、长视频稳定性及多人互动上全面跃升。模型采用DMD蒸馏实现8步生成,效率提升约15倍。

网易有道开源多模态大模型 Confucius4

网易有道AI团队开源多模态推理模型Confucius4,基于Qwen3.5-27B架构推出,专为高级数学推理设计。模型采用迭代SFT+RL训练与精细化CoT优化,在Math-Hard-500等基准达同等规模SOTA性能,推理链长度降低43.2%。Confucius4针对中文用户定向优化,支持图文混合输入,兼容Qwen生态。

阿里生产级 AI 数字员工平台 QoderWake 开启全球公测

QoderWake开启全球公测,首发Mac版,5分钟可配置数字员工上岗。开放后端、前端、测试、产品等6个内置岗位,支持自定义角色。工具具备长期记忆与进化能力,可通过IM、Webhook等方式接活,自动输出交付摘要。内置四维权限中心保障安全,支持MCP接入企业系统,7×24小时自主协作。

5月21·周四

智谱推出下一代大模型推理网络架构 ZCube

智谱联合驭驯网络与清华大学推出ZCube组网架构,针对PD分离推理拥塞难题,取消Spine层,采用扁平化拓扑与单/多轨混合接入。GLM-5.1 coding实测显示,ZCube使交换机及光模块成本降33%,GPU推理吞吐提升15%,首Token时延TTFT P99降40.6%,为下一代超大规模推理集群提供高效底座。

阿里 D20 全球设计院长峰会正式开票,堆友携手参会

阿里D20全球设计院长峰会2026正式开票,堆友再度携手参会。本届以”设计新生”为主题,主论坛聚焦大模型、Agent、AIGC及空间智能,分论坛涵盖阿里云”Vibe Designing”、淘天AI设计Agent、千问AI硬件UX等前沿方向,并首发AI设计实战工作坊与AI设计展。

火山引擎Agent Plan、Coding Plan上新,新增DeepSeek V4

火山引擎方舟 Coding Plan 与 Agent Plan 同步接入 DeepSeek V4 系列模型,两种套餐包中均可使用 DeepSeek V4 Pro 和 V4 Flash。Coding Plan 面向开发者编程场景,Agent Plan 聚合 DeepSeek V4、豆包 Seed 系列等多模态模型及联网搜索等 Harness 能力,通过订阅制能大幅降低调用成本。

腾讯混元开源 Hy-MT2 翻译模型和Hy 翻译小程序

腾讯混元开源新一代翻译大模型 Hy-MT2,提供 1.8B、7B、30B-A3B 三个尺寸,支持 33 种语言互译及 5 种民汉/方言。其中 7B 和 30B-A3B 在多项评测中达到开源模型最佳效果。同时推出腾讯 Hy 翻译小程序,支持语音输入、自定义翻译风格及离线翻译,iOS 与安卓 APP 即将上架。

腾达Marvis正式上线,无需邀请码

腾讯操作系统级AI助手腾讯Marvis(马维斯)正式上线,官网开放Windows、Mac及安卓端下载,无需邀请码即可体验。产品由应用宝团队推出,内置6名24小时在线AI Agent,支持读取本地文件、操作电脑软件与手机App,具备系统级文件MCP服务。

5月20·周三

阿里千问推出新一代旗舰模型 Qwen3.7-Max

阿里通义千问推出旗舰模型 Qwen3.7-Max,定位面向智能体时代的全能基座。模型在编程、办公自动化与长周期自主执行方面表现突出,曾在 35 小时、超 1000 次工具调用的内核优化任务中实现 10 倍加速。基准测试显示,模型在 SWE-Pro、MCP-Atlas 等多项智能体评测中领先同行。

阿里通义推出实时同声传译模型 Qwen3.5-LiveTranslate

阿里通义千问推出实时同传模型 Qwen3.5-LiveTranslate,支持 60 种语言音频输入与文本输出、29 种语言音频输出,端到端字均延迟低至 2.8 秒。模型基于 Qwen3.5-Omni 架构,具备实时音色克隆能力,可保留说话人原声特征,内置 1000 个热词的行业术语翻译优化。

阿里云推出全新MaaS模型服务平台「千问云」

阿里云在2026阿里云峰会上发布为AI Agent而生的全新产品千问云,集成Qwen、DeepSeek、Kimi等150余款主流模型API。平台将模型服务全面Skill和CLI化,Agent一句指令可自动完成模型选型、调用与任务执行,无需人工编写集成代码。

智象未来推出旗舰级图像生成模型 HiDream-O1-Image-Pro

智象未来开源 HiDream-O1-Image-Pro,基于UiT原生全模态架构,将图像像素、文本与任务条件统一映射至共享token空间,抛弃传统VAE与分离编码器。在GenEval、DPG等基准刷新SOTA,Artificial Analysis竞技场排名第8,超越FLUX.2[Dev]等开源模型。

微信读书官方推出 AI 助手扩展能力「微信读书Skill」

微信读书官方推出微信读书Skill,用户通过API Key绑定账号后,AI可调用个人阅读数据,实现查书架、搜书、统计阅读习惯、整理笔记及个性化推荐等六大功能。微信读书Skill支持部署至WorkBuddy等AI助手,安装后可用自然语言查询阅读记录,可批量导出划线笔记至Obsidian和Notion,让个人阅读数据真正被AI激活。

5月19·周二

Cursor 上线自研 Agentic 编程模型 Composer 2.5

马斯克在X平台邀请用户测试Cursor最新版本模型Composer 2.5,模型部分调用Colossus 2训练而成。Cursor官方表示,模型基于月之暗面Kimi K2.5训练,重点提升长任务稳定性与复杂指令遵循能力。技术上采用基于文本反馈的定向强化学习,合成训练规模扩大至前代25倍,使用分片Muon与双网格HSDP优化训练效率。

腾讯内测操作系统层个人 AI 助手腾讯Marvis

腾讯内测操作系统级 AI 助手腾讯Marvis,由应用宝团队开发,可在用户电脑本地部署 6 个 AI 智能体协同工作。产品支持自然语言指令完成文件管理、系统设置调整、跨模态内容检索及多任务自动化执行,采用云端效率与本地隐私双模式运行,敏感操作设 L2 级硬垂询确认

5月18·周一

xAI推出首款终端原生 AI 编程智能体Grok Build

xAI推出首款 AI 编程智能体Grok Build,对标Claude Code,支持并行Subagents、兼容现有工作流与MCP,具备计划模式与终端内图像视频生成能力,目前面向SuperGrok Heavy订阅用户开放。与此同时,xAI正经历动荡,马斯克将xAI并入SpaceX并更换logo。

LibTV 推出专业级 AI 视频协作工作台「LibTV团队版」

LibTV团队版正式上线,定位为AI视频专业级协作工作台。LibTV团队版提供专属项目空间、多人实时画布协作、统一资产库、分级权限管理、共享积分池及成员资产自动交接六大功能,面向AI视频工作室、短剧承制方、品牌市场部及企业内容团队。

腾讯推出AI应用生成平台「吐司」

腾讯推出探索型vibe coding产品吐司,定位应用生成及灵感共创平台,用户无需代码基础,自然语言描述可让AI完成从功能拆解到App打包的全流程。产品支持创造应用、社交分享、灵感广场复刻创作及AI应用搜索,构建”想法→应用→分发→共创”闭环。

腾讯AI设计工具 Ardot 正式全面公测

腾讯AI设计工具Ardot正式全面公测,面向产设研团队开放。Ardot支持文/图生成UI设计稿、局部修改及批量图标,通过MCP协议实现设计稿一键转代码,兼容CodeBuddy、Cursor等IDE。产品具备多人协作、权限管理与开发者模式,深度兼容Figma且性能更优。

5月15·周五

月之暗面推出Kimi WebBridge,让 AI 帮你操作浏览器

月之暗面推出 Kimi WebBridge 浏览器插件,面向 Kimi Code、Claude Code、Cursor、Codex 等本地 AI Agent,让 AI 携带用户登录状态与 Cookie 直接操作浏览器,实现点击、滑动、输入、填表、跨站信息整合等自动化任务。用户只需在 Chrome/Edge 安装扩展并运行一条命令安装本地守护程序即可使用。

阿里推出Qoder 1.0,从AI IDE升级为智能体自主开发工作台

阿里推出 Qoder 1.0,从 AI IDE 升级为智能体自主开发工作台。新版本推出 Quest 独立视窗,支持跨项目多任务并行;整合记忆、Repo Wiki 与知识卡片为团队级知识引擎,引入 Experts 专家团及自定义 Agent 团队。目前 Windows、macOS 和 Linux 全平台已开放下载。

阿里云推出企业级AI建站平台万小智2.0

阿里云发布企业级 AI 建站平台万小智 2.0,启用全新升级品牌 LOGO 与虚拟人形象。新版本从单纯生成页面扩展为建站全链路覆盖:支持行业模板、参考网站一键搭建及专业需求文档生成;原生集成域名注册、ICP 备案、SSL 证书与一键部署,实现合规上线;配备可视化管理后台、智能问答与创意中心,交付可持续运营的线上阵地。

墨刀AI上线AI生成App功能

墨刀AI正式上线AI生成App功能,用户一句话描述需求,AI会主动反问对齐产品定位、视觉风格等细节,智能选定Ant Design、Shadcn UI等主流设计系统,快速生成基于React/HTML代码的高保真App应用。生成的设计稿可一键切换查看前端代码,直接交付开发。

5月14·周四

小米具身智能团队开源自动驾驶大模型 Xiaomi OneVL

小米具身智能团队开源Xiaomi OneVL一步式潜空间语言视觉推理框架。模型在业内率先实现 VLA、世界模型与潜空间推理的统一,兼具强悍推理能力与高速响应,精度超越显式 CoT,速度对齐潜空间 CoT 方案。在 ROADWork、Impromptu、Alpamayo-R1 等多项基准上达到 SOTA,提供语言与视觉双维度可解释性。

Runway推出AI视频创作智能体Runway Agent

Runway正式推出Runway Agent,对话式AI视频创作智能体。用户仅需描述需求,Agent在单轮对话中完成从概念构思、故事分镜到视觉方向的全流程规划,自动生成包含多场景、配音、对白及配乐的高分辨率成品视频。

豆包输入法推出macOS版本

字节跳动旗下豆包输入法macOS版本正式上线,苹果电脑用户可通过语音实现”用嘴打字”。macOS版本基于豆包App同款语音模型,支持任意输入框实时语音转文字,边说边出字且无时长限制。功能上支持多种方言及中英混说,可智能修正语气词、语病和口误,能记住用户个性化改词习惯等。

5月13·周三

谷歌推出 Gemini 电脑 Googlebook,把 AI 塞进光标

谷歌在安卓Show大会上推出首款为Gemini量身打造的Googlebook笔记本,搭载智能光标并支持跨设备体验。同时发布安卓版Gemini Intelligence,支持跨App自动执行多步骤任务、Chrome集成Gemini插件、Rambler语音转文字及自定义桌面组件。谷歌还与苹果联手新增端到端加密RCS,预告下周I/O大会将抢先预览智能眼镜。

MiniMax 推出 MiniMax Agent 升级版 Mavis

MiniMax推出MiniMax Agent升级版Mavis,上线Agent Teams功能,支持多角色Agent并行协作,通过Owner、Worker、Verifier架构解决单Agent停摆、漂移等痛点;同时合并TokenPlan与Agent Plan,一份订阅打通CLI、API、Agent全链路,覆盖M2.7及音视频模型,Credits额度灵活共享。

林俊旸创业,新公司估值约20亿美金

前阿里千问大模型技术负责人林俊旸已正式创业,聚焦世界模型与具身大脑。他已招募来自字节、腾讯及海外背景的核心成员,以约20亿美元估值启动融资,接触红杉中国、高榕创投等机构。此前,林俊旸因阿里云计划拆分Qwen团队离职,具身智能也是其在阿里未竟之业。

Claude Code 推出 Agent View,一个界面管理所有 AI 会话

Anthropic为Claude Code推出Agent View研究预览版,支持开发者在一个终端界面内同时调度、监控多个并行AI会话,无需多开窗口。用户可实时查看各任务状态,随时介入回复或切换会话且不丢进度。功能支持后台持续运行,将Claude Code从单线程对话工具升级为多任务”指挥中心”,适用所有付费计划。

5月12·周二

OpenAI推出AI网络防御工具Daybreak,斥资40亿美元成立新公司

OpenAI宣布成立OpenAI Deployment Company,获超40亿美元初始投资并收购英国AI咨询公司Tomoro,将150名前沿部署工程师嵌入企业,帮助客户将AI部署到销售、法务等核心业务流程,从模型提供商转型为AI经济部署层。同时推出AI网络安全工具Daybreak,整合最强模型、Codex及安全合作伙伴,自动化漏洞发现与修复,加速网络防御并持续保障软件安全。

办公小浣熊桌面版 2.0 升级发布

商汤办公小浣熊桌面版2.0升级发布,从”桌面入口”转型为”执行助手”,新增六大能力:直接读取本地20+格式文件、一句话操控浏览器、⌘K全局快捷唤起、连接飞书/企微/钉钉、本地跨会话记忆、定时自动执行任务。现Mac端已开启首批内测招募,限时免费使用,Windows端预计5月中下旬上线。

OpenBMB开源端侧多模态大模型MiniCPM-V 4.6

OpenBMB开源 MiniCPM-V 4.6 端侧多模态大模型,LLM 参数量仅 1.3B,模型总体积约 1.6GB,最低 6GB 内存即可流畅运行。模型基于 llama.cpp 框架,完整支持 iOS、Android、HarmonyOS NEXT 三大平台纯本地离线部署,具备图像理解、OCR、视频理解等多模态能力。

码上飞全新升级!不仅做APP,还能帮你做生意

码上飞宣布全新升级,进化为”用AI帮你做生意”的一站式平台。用户用中文可一句话生成微信小程序、App及网站。新版本为每个应用自动配备专属AI员工,支持内容创作、客户回复、数据分析等运营。同时自动生成管理后台集中管理订单、商品与经营数据,助力个人及小团队零门槛跑通业务。

阿里千问与淘宝全面打通

千问APP与淘宝全面打通,用户更新至6.9.1版本后,可在千问内直接完成商品挑选、对比及下单。依托AI能力,千问支持复杂条件精准筛选、模糊需求智能理解、场景化商品组合推荐,能识别”智商税”理性劝退,实现从搜索到购买的全链路AI购物体验。

5月11·周一

Uncharted Dynamics 获数百万美元融资

具身智能底层基础设施公司 Uncharted Dynamics 完成数百万美元种子轮融资,由险峰长青领投。公司聚焦高精度多体动力学求解器研发,为具身智能提供物理层面的”真值地基”,解决现有仿真系统在刚柔耦合、柔性接触等复杂交互中物理失真、导致模型难以迁移至现实的问题。

中国移动推出MoMA大模型聚合平台与MobileClaw智能体框架

2026移动云大会在苏州召开,中国移动围绕”算力新动能、智能新空间”为主题,设8大分论坛及8000㎡展区,吸引超10万人次观展。中国移动发布三大首创:桌面级AI办公智能体MobileClaw、大模型聚合平台MoMA、支持电话交互的移动AI云电脑,和AI-eSIM卡及万亿级Token服务体验包,布局吉瓦级AI数据园区。

火山引擎推出Agent套餐包「Agent Plan」

火山引擎正式推出Agent套餐包Agent Plan,首次将多模态模型与Harness工具深度整合。套餐聚合字节跳动自研的Doubao-Seed、Seedance、Seedream系列及GLM-5.1、Kimi-K2.6等主流模型,内置联网搜索、embedding等工具,适配Claude Code、OpenClaw等平台。

谷歌云智能体开源官方命令行工具agents-cli

谷歌云智能体开源官方命令行工具agents-cli,专为简化企业级 AI Agent 从开发到部署的全生命周期设计。工具集成 Gemini CLI、Claude Code、Codex、Cursor 等主流编程 Agent,内置 Workflow、Scaffold、Eval、Deploy 等7个技能包,支持本地模拟评估、自动化部署至 Cloud Run/GKE,提供人工模式随时接管流程。

QClaw上线文件空间功能,QClaw×腾讯文档× ima全面互通

腾讯QClaw正式上线「文件空间」功能,一次授权可打通本地文件、腾讯文档与ima知识库。用户可直接在QClaw内调用腾讯文档和ima资料让AI处理,生成内容后一键保存为腾讯文档并生成协作链接,或沉淀回ima知识库。实现从资料调取、AI加工到团队协作的全流程闭环。

5月9·周六

阶跃星辰推出实时语音大模型StepAudio 2.5 Realtime

阶跃星辰正式推出新一代实时语音大模型StepAudio 2.5 Realtime,模型具备三大核心能力:顶级副语言能力,可精准感知语调、语速、停顿等情绪细节;千万人设自定义,支持从性格到口癖的精细调节,打造专属AI角色;对话双商领跑,在情商与智商上双重进阶。

百度推出旗舰大语言模型文心 5.1

百度文心 5.1正式上线,总参数压缩至文心 5.0 的约 1/3、激活参数约 1/2,预训练成本仅为业界同规模模型的 6%。模型在 Arena 搜索榜以 1223 分位列全球第四、国内第一,Agent 能力超越 DeepSeek-V4-Pro,AIME26 数学竞赛得分 99.6 仅次于 Gemini-3.1 Pro。

蚂蚁百灵推出万亿级旗舰思考模型Ring-2.6-1T

蚂蚁百灵正式推出Ring-2.6-1T,模型采用万亿级参数规模,在推理、编程、多模态理解等能力上实现显著提升。百灵团队通过创新的训练架构优化,在保证模型性能的同时有效降低推理成本。Ring-2.6-1T 已面向开发者和企业用户开放 API 调用,支持文本、图像、代码等多种任务场景,进一步丰富国内大模型生态的选择。

通义灵码推出RepoWiki功能,一键生成结构化知识文档

通义灵码推出RepoWiki功能,支持为代码库自动生成覆盖模块关系、接口定义与实现逻辑的结构化知识文档,解决 AI 编程工具碎片化理解代码的痛点。RepoWiki支持全量生成、增量更新与 Git 目录同步,Wiki 文件可随代码提交实现团队共享。Repo Wiki 目前处于 Beta 阶段,面向企业标准版与专属版用户开放免费体验,

OpenAI推出网络安全专用模型GPT-5.5-Cyber

OpenAI 宣布推出GPT-5.5-Cyber限量预览版,优先向经过审核的网络防御者开放。模型基于 Trusted Access for Cyber(TAC)框架,在 GPT-5.5 基础上降低安全相关任务的拒绝率,支持漏洞验证、恶意软件分析等防御工作流,同时保留对恶意活动的防护。

5月8·周五

OpenAI 推出三款实时语音模型

OpenAI推出三款实时语音模型:GPT-Realtime-2具备GPT-5级推理与工具调用能力;GPT-Realtime-Translate支持70多种语言实时互译,每分钟成本仅约0.25元,较人类同传降低百倍;GPT-Realtime-Whisper实现低延迟语音转录。三模型均通过Realtime API开放,端到端处理保留语调情感。

商汤推出轻量化多模态智能体模型SenseNova 6.7 Flash-Lit

商汤推出新一代轻量化多模态智能体模型SenseNova 6.7 Flash-Lite,采用原生多模态架构实现”看、想、做”一体化,Token 消耗较纯文本智能体直降 60%,在多项权威智能体基准测试中获同级别 SOTA。同时同步推出 SenseNova Token Plan 限时免费,支持每 5 小时 1500 次调用。

美团推出 AI 原生共生社区「觅游」

美团推出 AI 原生社区觅游并开启公测。产品定位为面向大模型与 Agent 的共生社区,首创养虾模式,用户饲养的 AI Agent 虾可协助寻找赚钱机会、结识伙伴。目前平台已入驻超 3000 个 Agent、汇聚 4 万余项 Skill。

360旗下AI办公平台推出AI PPT工具JJT

360集团旗下360 AI办公平台推出 AI PPT 工具 JJT,支持一句话生成、文档/大纲转 PPT、长内容总结汇报等创作模式,兼容 PDF、DOC、PPTX 等十余种格式上传。工具智能编辑能力涵盖一键换风格、精准配图、电影级转场、数据转图表及 AI 撰写演讲稿,支持 PPTX、HTML、PDF 多格式导出。

共绩科技完成近亿元Pre-A轮融资

共绩科技宣布完成近亿元Pre-A轮融资,由春华创投、彼岸时代联合领投。公司独创”电网式算力调度网络”,整合全球闲时、异构算力资源,通过AI算法实现供需动态匹配,让算力像电力一样按需取用、按量计费。平台已服务超5000家团队及企业,帮助客户降低算力成本超50%,典型客户包括LiblibAI、Remy等。

OpenAI推出Codex Chrome扩展插件

OpenAI 正式推出Codex Chrome扩展插件,支持 Codex 直接操作用户已登录的 Chrome 浏览器,包括读取打开标签页、页面内容及已登录网站信息,支持导航、点击、输入和截图等交互操作。用户可随时停止任务并在设置中管理访问权限,与新网站交互前需经确认。

5月7·周四

Anthropic与SpaceX达成合作扩容算力

Anthropic 在 Code with Claude 开发者大会连放数招:Claude Code 调用限额翻倍至 10 小时并取消高峰削减,Claude Opus API 速率限制大幅放宽;托管智能体新增多智能体编排、目标结果与自主推演三大能力;Claude Code 更新远程控制、无闪烁渲染等十余项功能,同时与 SpaceX 达成算力合作。

月之暗面 Kimi 完成新一轮约20亿美元融资

月之暗面(Kimi)完成约20亿美元D轮融资,投后估值突破200亿美元,创中国大模型最大单笔融资纪录。本轮由美团龙珠领投,中国移动等参投,累计融资超44亿美元居国内大模型创业公司之首。公司4月年度经常性收入超2亿美元,并发布开源旗舰模型Kimi K2.6。

大基金领投DeepSeek,估值接近450亿

据《金融时报》报道,国家集成电路产业投资基金(大基金)正洽谈领投 DeepSeek,本轮估值接近 450 亿美元(约 3067 亿元),较半月前 200 亿美元翻倍。创始人梁文锋或亲自跟投,腾讯、阿里亦在洽谈参投。大基金此前从未投资 AI 大模型公司,DeepSeek 为首家。

字节跳动推出统一多模态模型Mamoda2.5

字节跳动开源全球首个25B级统一多模态模型Mamoda2.5,基于Qwen3-VL-8B架构,总参数250亿每次仅激活约3亿。模型实现了文生图、文生视频、视频编辑等全任务SOTA,推理速度比阿里Wan2.2快12倍、比美团LongCat Video快18倍,视频编辑延迟仅9.2秒。模型在多项视频编辑基准测试中排名第一,性能接近闭源Sora和Kling。

无问芯穹再获超7亿融资

无问芯穹宣布再获超7亿元融资,由杭州高新金投集团和惠远资本联合领投,持续稳居中国AI原生基础设施公司融资规模之首。公司首发”AI生产力公式”,定位Token经济枢纽,其Agentic MaaS平台日均Token调用量较去年底增长超20倍。

OpenAI开放超大规模AI训练网络协议MRC

OpenAI 联合 AMD、博通、英特尔、微软、英伟达五大巨头推出多路径可靠连接(MRC)协议,通过 OCP 向全行业开源。MRC 基于 RoCE 扩展,采用多平面网络设计与自适应数据包喷淋技术,将数据包分散至数百条路径并行传输,避免网络拥塞与热点,使故障恢复从秒级缩短至微秒级。

像素绽放PixelBloom 完成C轮融资

像素绽放PixelBloom完成C轮融资,由国科投资与商汤国香资本联合领投。公司从AI视觉表达平台全面跃迁为”AI办公解决方案Agent”,推出全球首个营销方案Agent”小方同学”,实现从”生成内容”到”交付结果”的质变。C端产品AiPPT已覆盖3000万用户,B端深度嵌入联想、华为等硬件生态及中信证

硅基流动跻身中国 MaaS 市场第一梯队

据IDC报告,2025年中国企业级MaaS市场规模达1944万亿Tokens,同比增长16倍。硅基流动作为唯一创业公司跻身公有云MaaS前四,与火山引擎、阿里云、百度智能云同处第一梯队,验证”第三类MaaS”模式价值。

5月6·周三

OpenAI推出ChatGPT新一代默认模型GPT-5.5 Instant

OpenAI 正式推出GPT-5.5 Instant ,取代 GPT-5.3 Instant 成为 ChatGPT 默认模型。模型主打更准确、更简洁、更懂你:医疗/法律/金融领域幻觉率下降 52.5%,数学竞赛得分大幅提升;回复更简短自然,减少格式堆砌。Plus/Pro 用户可调用历史对话和文件实现个性化回答,所有消费者版本将新增「记忆来源」功能供用户查看与管理。

美国开发者开源DeepSeek版Claude Code,DeepSeek-TUI

美国开发者 Hunter Bown 推出的DeepSeek-TUI 近日在 GitHub 爆火,获 2.3k Star,被誉为”DeepSeek 版 Claude Code”。工具用 Rust 编写、支持MIT 开源,是专为 DeepSeek V4 优化的终端编程 Agent,支持文件操作、Shell 执行、Git 管理、MCP 接入等功能。

豆包测试增值付费服务,保留免费基础版

字节跳动旗下AI助手豆包推出付费订阅服务,分为标准版68元/月、加强版200元/月、专业版500元/月三档,同时保留免费基础版供日常使用。目前付费功能仍在测试阶段。据量子位智库数据,4月豆包APP日活突破1.4亿,环比增长21%,月下载量约5000万,稳居国内AI助手市场首位,断层领先千问、元宝等竞品。

ChatGPT上线广告主平台

OpenAI 宣布推出ChatGPT广告主平台,推出更灵活的购买方式。广告主现可通过电通、WPP 等代理商及 Adobe、Criteo 等技术伙伴购买广告,也可用美国地区测试中的自助 Ads Manager 直接投放。同时ChatGPT广告新增 CPC 竞价模式,上线转化 API 与像素追踪等测量工具。

讯飞智文推出Vision Agent模式,重构 AI PPT 生产流程

讯飞智文Vision Agent模式,重构AI在PPT生产链条中的角色。Vision Agent模式通过意图洞察、大纲构建、内容精炼与五步设计引擎,实现从被动生成到主动协同的转变,解决模板化、配图脱节等痛点。系统可联网搜索资料、自主推演页数结构、生成可编辑内容卡片,最终输出专业排版。

5月3·周日

xAI 推出最新旗舰推理模型Grok 4.3

xAI 推出 Grok 4.3 模型,定位为务实过渡版本。模型 API 价格降低 40%-60%,输出速度达 196 Tokens/s,支持 100 万 Token 长上下文,在代理任务和办公辅助能力上提升明显,更擅长生成文档、表格和演示文稿。模型在 Intelligence Index落后于 GPT-5.5和 Claude Opus 4.7,复杂推理、事实核查稳定性不足,且幻觉率有所上升。

OpenAI Codex 推出宠物模式

OpenAI编程工具Codex推出宠物模式,用户可在桌面养一只「赛博桌宠」。输入 /pet 可唤醒电子宠物,支持实时显示 Codex 工作状态(运行中/等待输入/可复核)及进度提示,无需打开应用可查看工作进展。用户可通过 hatch-pet 技能自定义专属宠物形象。

百度智能云推出AI短剧与漫剧创作平台Hogee

百度智能云推出一站式 AI 短剧创作平台Hogee,用户上传剧本或输入灵感后,AI 可自动生成角色、场景与分镜视频,覆盖从文本到成片的完整链路。平台支持 .txt/.docx/.pdf 等五种格式剧本上传,内置 OpenClaw 数字员工矩阵,提供社媒运营、营销素材、数据分析等能力。

DeepSeek 公布多模态模型技术报告

DeepSeek 在 GitHub 发布多模态大模型并公开技术报告,提出「基于视觉原语的思考」框架,将点、边界框等空间标记提升为推理「基本思维单元」,使模型具备精确空间指代与推演能力,突破传统链式思维在复杂空间参照任务中的瓶颈。模型架构紧凑、视觉标记效率高,在计数与空间推理基准测试中可与 GPT-5.4、Claude-Sonnet-4.6 等前沿模型匹敌。

阿里通义开源大模型可解释性工具套件Qwen-Scope

阿里通义开源大模型可解释性工具套件Qwen-Scope,工具基于稀疏自编码器(SAE)技术,覆盖 Qwen3 及 Qwen3.5 系列共 7 个模型。Qwen-Scope可在推理阶段定向控制输出结果,用少量种子数据完成数据分类与长尾样本合成,支持定位异常特征优化语言混用和重复生成问题。

美国防部与7家AI公司签署机密系统部署协议

美国国防部发布声明,已与 SpaceX、OpenAI、谷歌、英伟达、Reflection、微软和亚马逊云(AWS)7 家领先 AI 公司达成协议,加速美军转型为「人工智能主导」的作战力量,增强其在所有战争领域的决策优势。标志着美军正式将顶尖民用 AI 技术深度纳入国防体系,推动 AI 在军事指挥、情报分析与作战决策中的规模化应用。

4月30·周四

阿里推出数字员工QoderWake和Qoder移动端两款Agent产品

阿里正式推出数字员工平台QoderWake及Qoder移动端。QoderWake采用Harness-First架构,具备多维度自进化能力,可将经验沉淀到记忆、技能等五个维度,解决通用Agent”做完即忘”问题。目前已上线”数字程序员”,在阿里内部实现全流程无人值守的根因分析与代码修复,将单条问题分析耗时从30分钟缩短至2分钟。

蚂蚁百灵开源万亿级综合旗舰模型Ling-2.6-1T

百灵大模型Ling-2.6-1T正式开源面向复杂任务的万亿级综合旗舰模型。模型依托 MLA 与 Linear Attention 混合架构,以极低 Token 消耗实现高智效比,综合智能与 GPT-5.4(Non-Reasoning)同档。在 AIME26、SWE-bench Verified、BFCL-V4 等多个执行类基准上达到开源 SOTA,具备强 Agent 执行、代码生成与长上下文理解能

腾讯混元开源手机端离线翻译模型Hy-MT1.5-1.8B-1.25bit

腾讯混元开源手机端离线翻译模型Hy-MT1.5-1.8B-1.25bit,将支持33种语言、1056个翻译方向的翻译大模型极致压缩至 440MB,无需联网可在手机本地运行。模型基于1.8B参数的Hy-MT1.5打造,采用Sherry稀疏量化技术(ACL 2026录用),翻译质量超越谷歌翻译等主流系统。

宇树发布双臂人形机器人 ¥2.69万元起

宇树科技发布双臂人形机器人,起售价 2.69万元。产品具备15-31个总自由度,支持固定底座与移动底盘两种部署方式,配备高性能电机、减速器及传感器,搭载视觉双目模组与语音交互系统,头部算力达10TOPS。产品面向多场景落地,支持全栈开放的底层二次开发,定位为超快速部署的高性能双臂机器人解决方案。

4月29·周三

商汤开源日日新系列原生理解生成统一模型SenseNova U1

商汤正式开源日日新SenseNova U1系列原生理解生成统一模型。模型基于自研NEO-unify架构,摒弃传统拼接式设计,在单一架构内统一多模态理解、推理与生成。本次开源轻量版SenseNova U1 Lite,包含8B稠密网络与A3B MoE网络两个规格。在图像理解、生成编辑及视觉推理等多项基准测试中,达到同量级开源模型SOTA水平。

阶跃星辰推出新一代图像生成编辑模型 Step Image Edit 2

阶跃星辰正式推出新一代图像生成编辑模型 Step Image Edit 2。模型仅3.5B参数,在实际表现中超越12B-20B级开源图像编辑大模型,单次生图只需0.5-2秒,在KRIS-Bench榜单轻量级图像编辑模型综合排名第一。模型支持图像生成与编辑、中英文渲染、局部编辑、视觉推理、风格迁移等功能,覆盖IP创作、海报设计、人像美颜等场景。

科大讯飞推出MoE架构大语言模型星火X2-Flash

科大讯飞星火X2-Flash正式推出并开放API。模型采用MoE架构,总参数30B,支持256K超长上下文,基于华为昇腾910B国产算力集群训练。在智能体与代码能力上大幅提升,经实测效果接近万亿级参数模型,Token消耗成本不到主流大模型的三分之一。模型已接入AstronClaw、Loomy等平台,兼容OpenClaw等主流Agent框架。

蚂蚁百灵开源高效Instruct模型Ling-2.6-flash

蚂蚁集团旗下百灵大模型宣布 Ling-2.6-flash 正式开源,同步提供 BF16、FP8、INT4 等多精度版本,模型已上线 Hugging Face 与 ModelScope。模型总参数 104B、激活参数 7.4B,两周前曾以 Elephant Alpha 匿名身份登陆 OpenRouter,迅速获得开发者社区与行业用户的广泛关注。

DeepSeek识图模式开启灰度测试

DeepSeek多模态”识图模式”已开启灰度测试,部分用户可在首页看到新入口。上传图片后,DeepSeek能像人一样理解画面中的物体与场景。实测显示,识图模式可准确判断动物品种、通过建筑与文字线索识别杭州灵隐寺给出精确坐标,还能识破视觉陷阱图片。

英国AI初创公司Ineffable,完成11亿美元种子轮融资

前谷歌DeepMind首席科学家、AlphaGo核心研发者David Silver创立的英国AI公司Ineffable完成11亿美元种子轮融资,估值达51亿美元,本轮融资由红杉资本与光速创投领投,英伟达、谷歌等参投,创欧洲史上最大种子轮纪录。公司致力于打造无需人类数据、通过自主实践探索知识的”超级学习系统”。

4月28·周二

微软 GitHub Copilot 宣布转向按量计费

GitHub Copilot宣布6月1日起转向按量计费,以AI Credits替代固定额度,按Token消耗计费。基础订阅价不变:Pro每月10美元、Pro+每月39美元,均含等值Credits,代码补全不消耗额度。企业版支持共享额度池,Business和Enterprise客户6至8月可获额外促销额度。年度用户维持原计费至期满。

小红书首次公布「AI治理主张」

小红书首次公布「AI治理主张」,明确三大原则:欢迎创作者使用AI作为创意放大器;鼓励对AI生成内容主动标识,未标注者平台将统一添加标识;严守真实底线,坚决反对AI造假与侵权。平台将持续建设AI内容识别治理能力,同时上线AI笔记贴条提示的申诉通道,保障创作者权益,守护社区真实、公平、温暖的底色。

OpenAI 和微软联合宣布云合作独家限制正式解除

微软与OpenAI修订合作协议,解除云合作独家限制,OpenAI产品仍优先在Azure发布,且可通过任何云提供商向客户提供服务。知识产权授权从独家变为非独家,延至2032年。微软不再向OpenAI支付分成,OpenAI向微软的分成延续至2030年但设总额上限,与技术进展脱钩。微软同时获得独立追求AGI的权利。

百度文库网盘联合推出通用智能体GenFlow4.0

百度AI DAY推出通用智能体GenFlow4.0,目前通用智能体GenFlow的月活用户已经突破1亿。新版本全面升级Office Agent,一句话即可生成PPT、处理Excel数据、撰写Word长文档;记忆中心支持自主规划与个性化记忆。同时深度兼容OpenClaw,实现手机电脑无缝协作与Skills跨平台迁移。

阿里通义推出全新强化学习框架EAPO

阿里通义实验室推出全新强化学习框架EAPO(Evidence-Augmented Policy Optimization),引入”证据奖励”机制,将监督从答案下沉到证据提取过程,解决大模型长文本推理中”搜对却答错”的幻觉问题。框架基于Qwen3-30B的模型在多个权威长文本基准测试中表现优异,反超120B参数的GPT-OSS和Claude-Sonne

阿里QoderWork推出专家套件功能

阿里 QoderWork 正式上线「专家套件」功能,首批发布覆盖金融、法律、营销、财税、咨询、产品六大领域的 10 个预制套件,将专业知识、工作流程与数据连接器打包集成至 AI,用户无需编写 Skill 可一键调用、开箱即用。同时支持企业与用户自定义封装专属套件,实现业务配置与使用分离。

4月27·周一

LibTV 全网首发上线HappyHorse 1.0视频模型

LibTV 全网首发新一代视频模型 HappyHorse 1.0,支持文生视频、图生视频及参考图生成三种模式,可输出 15 秒 1080P 多镜头叙事视频。模型具备自然语言视频编辑、电影级画面质感、智能分镜编排、音画同步生成及多风格还原能力,在人物动作自然度、微表情刻画和对话真实感方面显著提升。

堆友第一时间上线HappyHorse 1.0视频模型

阿里巴巴旗下堆友平台上线 HappyHorse 1.0 视频模型,限时折扣低至 12 堆豆/秒,5 秒视频不到 1 元。用户登录官网点击「视频生成」入口即可体验,模型支持 3D 动画广告、无人机运镜、多人实景互动及氛围感镜头等场景,面向设计师、AI 爱好者等群体提供高性价比的视频创作能力。

DeepSeek API输入缓存降价90%

DeepSeek官方宣布全系API服务输入缓存命中价格降至原有价格的1/10。DeepSeek-V4-Pro缓存命中输入降至0.025元,DeepSeek-V4-Flash降至0.02元。Pro模型在5月5日前可叠加2.5折限时优惠。本次大幅降价为降低开发者调用成本,提升长上下文场景下的API使用性价比。

小米开源 VLA 大模型 Xiaomi-Robotics-0 后训练全流程

小米机器人事业部开源 Xiaomi-Robotics-0 真机后训练全流程。基于预训练基座,用20小时任务数据可完成耳机收纳等高精度操作。团队通过异步推理、动作前缀及自适应加权、Λ型掩码、随机遮蔽三重策略,破解模型”偷懒效应”,实现动作连贯与视觉灵敏的平衡。

灵光App推出体验世界模型功能

灵光App上线「体验世界模型」功能,首次将世界模型能力引入手机端。用户只需上传一张图片,选择「生成图中世界」或输入探索指令,可一键生成可交互的3D虚拟世界。进入场景后,可通过摇杆控制移动用第一人称视角自由漫步,像玩游戏一样沉浸式探索。

星动纪元完成超2亿美元新一轮融资

具身智能企业星动纪元完成超2亿美元新一轮融资,由顺丰集团领投,红杉中国、IDG资本、中金资本等联合注资,多家产业方共同参与。星动纪元实现了具身行业首个PMF,已携手中国邮政、顺丰等落地10余个物流中心,部分场景作业效率超人类85%,将于2026年Q2开启千台级机器人批量交付。

阶跃星辰与腾讯云达成战略合作

阶跃星辰与腾讯云达成战略合作,双方将整合阶跃星辰端到端语音大模型与多模态理解技术,结合腾讯云基础设施及内容生态优势,共同加速大模型上车进程。合作聚焦智能座舱场景,打造免唤醒、连续对话、情绪识别的主动式AI交互体验,联动腾讯音乐、视频、地图等服务,实现车内服务闭环。

芒果传媒与爱诗科技达成战略合作

芒果传媒与爱诗科技签署战略合作协议,合作将以芒果全景工作站为载体,将爱诗科技AI视频大模型能力系统性接入芒果内容生态,推动AI技术在音视频创制、AI影游、IP开发等核心业务场景落地。双方将围绕内容生产、互动娱乐及内容全球化三大方向展开深度合作,探索AI视频在短剧、动画、综艺视觉及实时互动内容中的产业化应用。

4月24·周五

DeepSeek推出DeepSeek-V4 预览版

DeepSeek全新系列模型 DeepSeek-V4 的预览版本正式上线并同步开源,包含deepseek-v4-pro 和 deepseek-v4-flash两个版本,均支持 1M 超长上下文。V4-Pro 在 Agent 编码、世界知识与推理性能上比肩顶级闭源模型;V4-Flash 用更低成本提供接近的推理能力。模型采用全新注意力机制与 DSA 稀疏注意力,大幅降低长上下文计算与显存开销。

OpenAI 推出最新旗舰大模型GPT-5.5

OpenAI推出新一代旗舰模型GPT-5.5,定位”面向实际工作与智能体的新型智能”。模型与英伟达GB200/GB300 NVL72系统联合设计,在编程、知识工作及科学研究领域全面超越前代与Claude Opus 4.7。GPT-5.5打破”更强必更慢”定律,速度与GPT-5.4持平且token消耗更少。

讯飞Loomy全面开放,开启“外挂”办公模式

讯飞旗下AI办公助手Loomy宣布全面开放,无需邀请码可注册使用。Loomy已完成超5000个真实任务闭环,覆盖金融、电商、教育等20余个行业,新用户留存率达70%。本次升级推出三大核心能力:集成飞书、企微、钉钉CLI实现自然语言操控IM工具;PPT引导式创建,通过选择题生成专业演示文稿;支持多任务并行处理,提升办公效率。

阶跃星辰推出新一代自动语音识别模型StepAudio 2.5 ASR

阶跃星辰推出新一代自动语音识别模型StepAudio 2.5 ASR。模型率先将大语言模型推理加速技术引入语音识别领域,基于ASR+MTP-5架构,实现推理速度提升400%、时延降低60%、峰值达500 tokens/s,成本直降80%。在多项中英文主流评测基准上达到SOTA水平,模型复用32K上下文窗口,单次可完整转写30分钟长音频。

阿里云推出企业级智能体构建平台JVS Crew

阿里云推出企业级智能体构建平台JVS Crew,以”被集成”为设计理念,帮助企业快速在现有App或SaaS中嵌入生产级AI Agent能力。平台补齐OpenClaw在企业级场景的短板,通过身份、内容、执行三道安全墙实现自主可控,提供全托管跨会话记忆、端到端可观测Trace及四级预算成本管控。

4月23·周四

OpenAI 推出团队协作智能体Workspace Agents

OpenAI宣布在ChatGPT中推出Workspace Agents,支持团队创建协作智能体处理复杂任务和长周期工作流 。Workspace Agents由Codex提供底层支持,具备文件处理、代码运行、工具调用和记忆存储能力,可7×24小时云端运行。系统支持Slack集成与定时调度。目前支持ChatGPT Business、Enterprise、Edu和Teachers计划。

阿里通义开源稠密多模态模型Qwen3.6-27B

阿里通义千问团队开源Qwen3.6-27B,拥有270亿参数的稠密多模态模型。模型支持多模态思考与非思考模式,在智能体编程能力上实现旗舰级突破,于SWE-bench、Terminal-Bench等主要编程基准全面超越前代开源旗舰Qwen3.5-397B-A17B。作为稠密架构,模型无需MoE路由可部署,更便于广泛落地。

字节跳动推出新一代 3D 生成大模型Seed3D 2.0

字节跳动推出新一代3D生成大模型Seed3D 2.0,在几何与纹理两项核心指标上均达SOTA。模型引入Coarse-to-Fine两阶段DiT策略,解耦整体结构与精细细节,采用统一PBR生成架构结合MoE与VLM先验,大幅提升材质真实感。Seed3D 2.0拓展了部件级拆分、关节化建模及场景组合等下游能力,推动3D生成迈向”生产可用”。

腾讯混元开源快慢思考融合的混合专家模型Hy3 preview

腾讯混元团队推出Hy3 preview大模型,是团队从预训练、强化学习到基础设施全面推倒重建后的首个成果。模型采用快慢思考融合的MoE架构,拥有295B总参数、21B激活参数及256K长上下文,是混元迄今最智能的模型。Hy3 preview在FrontierScience-Olympiad、IMOAnswerBench等高难度推理榜单表现突出,Agent与代码能力大幅提升,可一次性生成完整微信小程

OpenAI开源隐私过滤模型OpenAI Privacy Filter

OpenAI开源OpenAI Privacy Filter模型,用于检测和编辑文本中的个人身份信息(PII)。模型总参数15亿,支持128K上下文,可在本地运行。模型基于双向token分类架构,能识别姓名、地址、邮箱、电话、账号、密码等8类隐私信息,在PII-Masking-300k基准上达96% F1分数。

阶跃星辰和千里科技达成全面战略合作

阶跃星辰与千里科技宣布达成全面战略合作,双方将共建「原生智驾基座模型」,从底层训练让AI直接理解复杂物理世界,突破物理AI能力边界。阶跃已在Agent基础大模型和全模态技术上深度布局,推出开源旗舰基座模型Step 3.5 Flash,在语音推理、自动驾驶评测等榜单取得领先。

Anthropic估值万亿美元

据《科创板日报》,AI初创公司Anthropic在Forge Global等未上市股权交易平台的估值飙升至约1万亿美元,超越OpenAI的8800亿美元。因买家竞相抢购Anthropic日益减少的二级市场股票,推动公司估值快速攀升。

4月22·周三

OpenAI正式推出图像生成模型ChatGPT Images 2.0

OpenAI正式推出ChatGPT Images 2.0(GPT-Image-2),是其首个具备思考能力的图像生成模型。模型在准确性、时效性、一致性和视觉连贯性上表现突出,仅凭简单提示词可生成以假乱真的App截图、TikTok视频界面、商品广告及论文海报等复杂图像,中文文字渲染能力显著提升。

马斯克600亿美元收购Cursor

马斯克旗下商业航天巨头SpaceX官宣与AI编程独角兽Cursor达成深度合作,计划今年晚些时候以600亿美元收购,如果最终不执行收购,可为合作支付100亿美元。双方将结合Cursor的领先产品与SpaceX百万H100等效算力的Colossus超算,共建世界最强编程AI。

AI互动内容社区Loopit完成1亿美元融资

AI互动内容社区Loopit母公司涌跃智能完成新一轮5000万美元融资,由全球头部手游厂商Garena领投,蓝驰创投等机构跟投,年内累计融资近1亿美元。Loopit由前百川智能联合创始人陈炜鹏创立,上线两月即登上Google Play全球总榜第8、娱乐榜第1,获马斯克点赞。

代号为 Elephant Alpha 的匿名模型正式揭晓:Ling-2.6-flash

蚂蚁百灵大模型团队推出Ling-2.6-flash,总参数 104B、激活参数 7.4B,采用 MLA+Lightning Linear 混合注意力与稀疏 MoE 架构。模型在4 卡 H20 环境下推理速度达 340 tokens/s,评测 Token 消耗仅同类约 1/10,在 BFCL-V4、SWE-bench Verified 等 Agent 基准达 SOTA。

商汤绝影推出端侧多模态智能体基座大模型Sage

商汤绝影推出端侧多模态智能体基座大模型Sage,采用MoE架构(32B总参数/3B激活),为行业首款车端复杂智能体基座模型。在PinchBench评测中任务完成率达94%,超越Claude-Opus-4.6、GPT-5.4等全球一线云侧大模型。Sage已在英伟达Orin X平台实现部署,将于北京车展推出Sage Box,推动智能座舱向超级智能体进化。

4月21·周二

月之暗面开源Kimi K2.6,全面精进代码和 Agent 集群能力

月之暗面开源Kimi K2.6模型,具备行业领先的代码、长程任务执行与Agent集群能力。模型在Humanity’s Last Exam、SWE-Bench Pro等多项基准测试中成绩持平或优于GPT-5.4、Claude Opus 4.6等闭源模型。K2.6可连续编码13小时、修改超4000行代码,Agent集群支持300个子Agent并行完成4000个协作步骤,支持长达5天的持续自

腾讯 QClaw 海外版正式开启内测

腾讯 QClaw 海外版正式开启内测,现已开放美国、加拿大、新加坡等多个国家和地区。产品主打零门槛、免部署、下载即用,支持通过 WhatsApp 或 Telegram 远程操控电脑完成报税、健身规划、社媒运营等任务。QClaw 海外版 99% 的代码由 QClaw 自主编写,用时 5 天。

阿里通义一站式自动优化引擎 AgentScope Tune 正式升级

阿里通义实验室宣布专为 Agentic AI 打造一站式自动优化引擎 AgentScope Tuner 正式升级。产品提供 Prompt 调优、模型选择、强化微调三大能力,覆盖从研发初期轻量优化到后期深度调优的全周期需求。核心亮点包括 Agent 原生闭环、统一 API 设计范式、零代码改造成本。

4月20·周一

Anthropic推出AI原生视觉设计协作平台Claude Design

Anthropic推出AI原生视觉设计平台Claude Design,由Claude Opus 4.7驱动,直接挑战Adobe、Figma等传统设计软件。产品具备三大核心能力:自动提取品牌设计系统、支持文档/截图/代码库等多模态输入、设计稿一键生成可运行代码。消息发布后,Adobe、Figma、Wix等设计软件巨头股价集体闪崩。

阿里通义推出下一代旗舰模型Qwen3.6-Max-Preview

阿里通义千问推出下一代旗舰模型的早期预览版 Qwen3.6-Max-Preview。相比前代,模型在智能体编程、世界知识和指令遵循方面显著提升,斩获六项编程基准最高分。用户可通过 Qwen Studio 在线体验,或经阿里云百炼 API 调用,兼容 OpenAI 与 Anthropic 协议。

阿里通义推出端到端语音识别大模型Fun-ASR1.5

阿里推出端到端语音识别大模型Fun-ASR 1.5,单模型覆盖30种语言,支持自动语种切换与跨语言混说。模型覆盖中文七大方言体系,字错误率较上版下降56.2%,新增古诗词专项识别准确率达97%。Fun-ASR 1.5采用MoE架构,支持智能标点预测与数字、日期等文本归一化,现已上线阿里云百炼及魔搭社区。

4月17·周五

智谱AutoClaw上线自进化机制与Skill商店

智谱AI旗下AutoClaw(澳龙)正式上线自进化机制与Skill商店。自进化功能可自动识别用户纠正、偏好及失败教训,经审批后固化为永久记忆,实现Agent越用越懂用户。平台同步推出GLM Office Skills五件套,基于GLM-5.1支持PPT、Word等细分场景设计、智能自检与格式互转,可一键生成配套办公材料。

Anthropic 推出最新旗舰大模型 Claude Opus 4.7

Anthropic正式推出Claude Opus 4.7,定位为当前最强可广泛使用的大模型。核心升级聚焦复杂任务执行、高清视觉理解和长链路工作流稳定性。视觉能力实现质的飞跃,在XBOW测试中从54.5%跃升至98.5%接近满分;编程能力达SWE-bench 80.5%;百万Token长上下文BFS测试从41.2%提升至58.6%。

阿里通义开源Qwen3.6-35B-A3B,智能体编程“小钢炮”

阿里通义千问团队开源Qwen3.6-35B-A3B稀疏MoE模型,总参数350亿但激活仅30亿,专为智能体编程优化,性能大幅超越前代同时可媲美更大稠密模型。模型支持多模态推理、思考与非思考双模式,在代码生成、工具调用等基准测试中表现突出。

4月16·周四

全球首个云端沙箱 Hermes:MaxHermes 正式上线

MiniMax正式推出全球首个云端沙箱Hermes——MaxHermes,基于Hermes Agent构建的云端自我进化AI助手。产品核心创新为学习闭环机制:每完成复杂任务自动提炼可复用的Skills能持续自我迭代,配备持久化记忆与多子代理并行能力。产品零门槛部署,已打通飞书、钉钉、企业微信等IM渠道,支持Token Plan抵扣消耗。

腾讯混元3D世界模型2.0发布:无缝对接游戏工作流

腾讯混元3D世界模型2.0(HY-World 2.0)正式发布并开源。模型支持文字、图片、视频等多模态输入,可一键生成、重建和模拟完整3D世界,支持导出Mesh/3DGS/点云等可编辑资产,无缝对接Unity/UE游戏引擎。相比1.0版本,2.0采用WorldMirror 2.0架构,画面精细度与真实感大幅提升,支持角色模式自由探索与物理碰撞。

阿里推出可实时构建和交互的开放式世界模型产品 HappyOyster

阿里巴巴ATH创新事业部推出开放式世界模型产品HappyOyster,现已正式启动内测。产品支持实时构建与交互,提供”Directing”实时导演和”Wandering”世界漫游两种玩法,用户可在无限生成的视频流中创作或在延展空间中自由探索。目前官网已开放申请,用户可加入Waitlist获取首批内测资格。

阶跃星辰推出新一代语音生成模型 StepAudio 2.5 TTS

阶跃星辰正式推出新一代语音生成模型StepAudio 2.5 TTS,具备全局语境控制、文中语境控制和零样本复刻三大核心能力。用户可通过自然语言精准调控语音情绪基调、语气节奏、停顿重音等细节,实现从”复现声音”到”创造表达”的跨越。模型支持任意音色零样本复刻,无需重新训练即可生成高品质语音。

智象未来宣布完成超5亿元新一轮融资

多模态生成式AI公司智象未来(HiDream.ai)宣布完成超5亿元新一轮融资,资金将用于原生全模态世界模型研发、企业智能体产品及全球市场拓展。公司开源模型HiDream-I1登顶Artificial Analysis榜单,开源下载量超200万次。目前产品覆盖3000万专业用户及4万多家企业客户,已形成商业营销、影视创作、社媒内容三大场景闭环。

网易有道推出 AI 知识库工具”有道宝库”

网易有道正式推出首个AI知识库产品“有道宝库”。产品定位为”外接超级知识库”,支持文档存储、智能问答及一键生成PPT、播客脚本、研究报告等内容。核心场景包括:30分钟掌握陌生领域知识并生成20页PPT;5分钟自动梳理全年项目文档生成年度总结;上传名人传记可模拟”名人董事会”提供决策建议能生成播客。

4月15·周三

百度文心开源文生图模型 ERNIE-Image

百度文心正式开源文生图模型 ERNIE-Image,仅8B参数达到开源SOTA水平,在文字渲染、复杂指令遵循等能力上媲美Nano Banana等商业闭源模型。模型24GB显存即可运行,支持中英日韩多语言精准字形生成,已上线ComfyUI并推出GGUF量化方案,相关权重与推理代码已在Hugging Face开源。

阿里推出AI开发工具秒悟Meoo

阿里ATH事业群推出首款AI开发工具Meoo(秒悟)。产品集成千问、Kimi、GLM、MiniMax四大顶尖模型,内置阿里云数据库、存储等核心服务。用户无需编程基础,通过自然语言描述需求,最快1分钟可自动生成完整前后端代码,支持在阿里云一键部署上线。

李飞飞旗下World Labs开源3D高斯溅射渲染引擎 Spark 2.0

李飞飞旗下World Labs开源3D高斯溅射渲染引擎Spark 2.0,支持通过WebGL2将超1亿splats的3D世界流式传输至桌面、手机及VR设备。引擎基于Three.js构建,采用连续型LoD高斯溅射树、渐进式流式加载和虚拟内存技术,实现超大规模场景在网页端的实时渲染,解决传统引擎仅支持单对象、缺乏动态动画及设备兼容性差等痛点。

Meta与芯片巨头博通宣布合作投入超1GW算力定制AI芯片

Meta宣布与芯片巨头博通签署五年长约(至2029年),初始投入超1GW算力用于定制AI芯片,扎克伯格宣称目标是”为数十亿人提供个人超级智能”。Meta计划两年内推出四代自研MTIA芯片(300/400/450/500),成立超级智能实验室,由Scale AI创始人Alexandr Wang担任首席AI官。

面壁智能推出专业级文档智能体工作台 Lantay

面壁智能推出专业级文档智能体工作台Lantay,现已进入公测阶段。产品借鉴Cursor设计理念,通过Vibedocing交互范式实现人机协同创作,采用导航区、工作区、对话区三合一布局。平台支持16种格式文件处理,单次可批量整合200个材料,单文件上限100MB。Lantay主要面向法律、金融、出版等高严谨行业的重度文档工作者。

4月14·周二

Seedance 2.0全面开放API服务

火山引擎正式上线 Seedance 2.0 API 服务,面向企业和个人开放视频生成能力。模型支持文、图、音、视频四模态输入,具备多模态内容参考与编辑能力,并建立肖像版权安全标准。目前已应用于影视文娱(如贾樟柯导演短片、春晚)、漫短剧、广告营销、AI工具、具身智能、自动驾驶等行业,助力创作效率提升。

MiniMax Agent 更新,重新设计 Agent 操作电脑的方式

MiniMax Agent 桌面端推出两项更新:Pocket 功能(Beta版)支持接入飞书、微信等主流 IM,用户可在聊天中直接指挥电脑执行任务并回传结果;Computer Use 功能让 Agent 可像人一样看屏幕、操作鼠标键盘,直接操控本地软件和系统设置。

4月13·周一

MiniMax开源新一代自我进化AI模型 MiniMax M2.7

MiniMax正式开源MiniMax M2.7,成为首个由AI深度参与自我迭代的模型,支持构建复杂Agent Harness及Agent Teams等能力,在软件工程与办公场景表现优异。开源首日与华为昇腾、摩尔线程、沐曦、昆仑芯、NVIDIA及Together AI、Fireworks等国内外芯片与推理平台完成适配。

MiniMax推出全新AI音乐生成模型 MiniMax Music 2.6

MiniMax推出Music 2.6音乐生成模型,新增Cover功能可基于现有歌曲改编风格与编曲,同时优化国风乐器时序演进、中低频表现及人声自然度。模型首包延迟降至20秒内,支持BPM、调性、段落结构等精准指令控制。同步开源三款Music Skill供Agent调用。

米哈游蔡浩宇AI公司推出首个AI视频模型LPM 1.0

米哈游创始人蔡浩宇的AI公司Anuttacon推出首个视频模型LPM 1.0。模型拥有170亿参数,支持实时生成能说话、唱歌、倾听并表达情绪的AI角色视频,可保持长时间身份一致性生成(支持22-48分钟视频)。技术上采用扩散Transformer架构与因果式流生成器,解决表现力、实时性与长视频一致性难题。

4月10·周五

阿里通义开源全模态知识库 RAG 框架 VimRAG

阿里通义实验室推出 VimRAG 框架,用动态有向无环图(DAG)替代线性上下文拼接,通过分支试错机制、视觉能量分配策略及图引导优化(GGPO),实现跨文本、图像、视频的精准检索与关联推理。实验显示,模型在Qwen3-VL-8B模型上准确率达50.1%,显著优于传统方案。

即梦推出 AI 原生动态叙事创作工具 Octo

即梦AI正式推出智能创作助手 Octo 小章鱼,以”Vibe Create”为核心理念,支持无流程束缚、无场景限定的自由创作体验。产品现已上线即梦官网开放内测申请,助力用户打破繁琐流程束缚,让创作回归纯粹自由的对话体验,随时随地轻松落地灵感。

4月9·周四

Meta 推出原生多模态大模型 Muse Spark

Meta超级智能实验室(MSL)推出首个模型 Muse Spark ,在Artificial Analysis跑分从Llama 4的18分跃升至52分,仅次于GPT-5.4和Gemini 3.1 Pro,推动Meta股价暴涨近10%。模型为原生多模态推理架构,具备视觉思维链、多Agent编排及”沉思模式”,在CharXiv视觉理解和HealthBench健康问答领域表现突出

萌友智能 ropet 完成轮超千万美元融资

AI 陪伴机器人公司萌友智能 ropet 完成 A 轮超千万美元融资,由北京市人工智能产业投资基金、峰瑞资本等投资。ropet 桌面 AI 宠物售价约 2000 元,累计出货近 2 万台,90 天留存率达 80-90%,核心用户日均互动超 2 小时。产品主打”生物性”体验,通过性格养成、轻互动建立情感连接。

4月8·周三

智谱开源新一代旗舰模型 GLM-5.1

智谱开源旗舰模型 GLM-5.1 ,为全球最强开源模型,可独立持续工作超8小时,自主完成复杂工程任务。模型代码能力在SWE-Bench Pro等基准测试中位列全球第三、国产第一,超越GPT-5.4与Claude Opus 4.6。实测可8小时构建完整Linux桌面系统、优化向量数据库性能近7倍、24小时迭代优化ML负载实现3.6倍加速。

爱诗科技推出全球首个影视行业大模型 PixVerse C1

爱诗科技推出首个影视行业大模型PixVerse C1,支持文生、图生、参考生、首尾帧生成及智能分镜,最高支持15秒1080P视频。模型具备多宫格分镜一键成片、复杂场景多角色精准调度、角色跨镜头一致性保持等能力,在打斗场面、特效渲染等工业级视效上实现突破。

Anthropic推出最强模型 Claude Mythos,性能碾压 Opus 4.6

Anthropic推出最强模型Claude Mythos预览版,性能碾压Opus 4.6。模型能发现数千个高危漏洞,攻击能力超绝大多数黑客。模型因安全风险过高,暂不向公众开放,仅通过”Project Glasswing”向Amazon、Apple、Google等巨头及40多家基础设施企业开放,用于防御性安全加固。

4月7·周二

Karpathy推出自运行个人知识库 LLM Wiki

前OpenAI科学家Andrej Karpathy推出 LLM Wiki 知识库构建方案,引发社区热议。LLM Wiki提出在Agent时代只需分享”想法文件”,由Claude、Codex等Agent自动构建个人知识库。系统分原始数据、Wiki、Schema三层,通过数据摄取、查询、质量检查形成闭环,支持知识持续积累与自我增强,适用于研究、阅读、企业知识管理等场景。

面壁智能完成新一轮数亿元融资

面壁智能完成新一轮数亿元人民币融资,由深创投与汇川产投联合领投,获评2026年中国独角兽企业。公司专注端侧大模型,践行”密度法则”,MiniCPM系列下载量突破2400万,已在长安马自达、吉利银河等汽车及智能手机、智能家居领域规模化落地。

OpenBMB开源语音合成模型 VoxCPM2

OpenBMB开源2B参数语音合成模型 VoxCPM2,采用无分词器扩散自回归架构,支持30种语言及中文方言,输出48kHz录音室级音质。模型首创Voice Design功能,可通过文字描述凭空创造声音;支持可控声音克隆与终极克隆模式。模型训练数据达236万小时,实时率低至0.13,采用Apache-2.0协议可商用。

字节跳动推出扣子2.5,开启全新 Agent World

字节跳动旗下扣子2.5正式上线,推出”Agent World”生态。新版本为 AI Agent 配备独立云电脑与云手机,支持 7×24 小时后台自主运行任务;集成视频创作、编程 CLI 及法律金融等行业专家技能;引入长期记忆系统,实现跨平台个性化协作。

微软推出全球最精准转录 AI 模型 MAI-Transcribe-1

微软推出AI转录模型 MAI-Transcribe-1,在FLEURS基准测试中以3.9%字错误率宣称全球最精准,支持25种主要语言,在11种核心语言上登顶,性能超越Whisper-large-v3和Gemini 3.1 Flash。模型批量转录速度达Azure Fast服务2.5倍,定价每小时0.36美元,已在Microsoft Foundry平台开放使用,暂不支持实时转录和说话人分离功能。

4月3·周五

谷歌推出 Gemma 4:同等规模下性能最强的开放模型

Google 推出 Gemma 4 系列开放模型,被称为”同等规模下性能最强”。模型包含 E2B、E4B、26B MoE 和 31B Dense 四个版本,专为高级推理和智能体工作流设计。31B 和 26B 模型在 Arena AI 排行榜上分别位列全球开放模型第3和第6位。全系支持多模态、长上下文及140多种语言,采用 Apache 2.0 许可开源。

Xiaomi MiMo Token Plan 全球发布

小米推出 Xiaomi MiMo Token Plan 订阅方案,采用统一Credit点数计费,取消5小时token使用限额。Token Plan提供Lite(¥39/月)、Standard(¥99/月)、Pro(¥329/月)、Max(¥659/月)四档套餐。方案适配Claude Code、OpenClaw等主流AI开发工具,用户可按需选择不同档位。

OiiOii开放注册,史诗级更新+满血Seedance2.0

AI视频平台OiiOii正式开放注册,接入满血Seedance 2.0模型,无需排队可生成高质量视频。本次更新新增多宫格分镜预览,告别”抽卡”式创作;推出自由画布模式,支持模型直接选择;上线场景资产与设计师功能,配合人物资产确保画面一致性。同时新增”真人”画风等热门风格,全面提升创作体验与效率。

阿里通义推出AI视频生成模型 Wan2.7-Video

阿里通义实验室推出视频生成大模型Wan2.7-Video,支持全模态输入与”指令P视频”式编辑,可精准增删改视频元素、修改台词动作及机位。Wan2.7-Video支持最多5个主体特征一致性控制、故事板分镜、创意复刻与剧情续写。模型以”戏核”为驱动,实现智能剧情设计、40+种表情演绎及专业运镜。

4月2·周四

智谱推出GLM-5V-Turbo:多模态Coding基座模型

智谱推出GLM-5V-Turbo多模态Coding基座模型。模型原生融合视觉与文本能力,支持从设计稿、截图直接生成可运行代码,上下文窗口达200k。模型在多模态Coding、GUI Agent等基准测试中表现领先,深度适配Claude Code与AutoClaw等Agent框架,让AI Agent具备”视觉”能力。

阿里通义推出Qwen3.6-Plus:编码智能体能力全面跃升

通义实验室推出Qwen3.6-Plus模型,支持通过阿里云百炼 API 开放调用。模型聚焦编码智能体能力跃升,在代码生成、修复及终端自动化等场景表现更稳定,默认支持 100 万上下文窗口,多模态感知与推理能力同步增强。模型在国内同尺寸模型中编码智能体能力领先,前端开发、复杂文档理解等任务表现突出。

OpenClaw推出中国官方镜像站ClawHub镜像站

OpenClaw官方推出ClawHub镜像站 ,解决国内访问技能市场缓慢问题。镜像站由字节跳动BytePlus和火山引擎赞助基础设施,提供完整中文界面与数据同步,持续收录社区高质量Skill。用户可通过cn.clawhub-mirror.com直接访问,在OpenClaw中无缝调用各类Agent技能。

B 站推出 AI 视频创作工具updream

B站自研AI创作工具updream正式开启内测,面向UP主提供轻量化、智能化创作体验。产品采用定向邀请制,创作者需邀请码获得使用权限。updream具备三大核心能力:灵感生成与内容构思、智能剪辑与高效制作、个性化技能库与项目管理。

4月1·周三

OpenAI获1220亿美元史上最大单笔融资纪录

OpenAI完成史上最大单轮融资1220亿美元,投后估值达8520亿美元,由亚马逊、英伟达、软银等领投。同时因日均成本高达100万美元且用户留存低迷,OpenAI关闭了视频生成产品Sora。标志着公司战略从惊艳Demo转向务实商业化,聚焦文本模型、代码生成和企业服务等稳定现金流业务,为IPO铺路,意图成为AI基础设施层。

通义实验室推出AI图像生成与编辑模型Wan2.7-Image

通义实验室推出AI图像生成与编辑模型Wan2.7-Image ,主打”人更真、字更稳、色更准”。模型支持深度自定义虚拟形象,避免”AI标准脸”;支持4000超长字符及多语言、表格、公式稳定生成,解决乱码痛点;新增”色彩控制调色盘”,可通过Hex色值精确控制品牌色,确保设计符合VI规范。

美团 LongCat 团队推出语音合成模型LongCat-AudioDiT

美团LongCat团队推出LongCat-AudioDiT语音合成模型,实现零样本音色克隆SOTA性能。模型直接在波形潜空间进行扩散生成,摒弃传统梅尔频谱中间表示,避免信息损失。LongCat-AudioDiT提出双重约束对齐(DCA)和自适应投影引导(APG)两项关键技术,修复训练-推理不匹配问题并缓解过饱和。

PixVerse推出三项更新:快应用、团队版与CLI工具

爱诗科技闪电发布周 Day 2 PixVerse 推出三项更新:快应用、团队版与CLI工具。快应用首批上线”广告大师”,支持商品图一键生成广告视频;团队版支持2-100人协作,提供共享积分池、四级权限及独立空间;CLI工具让开发者通过命令行调用视频生成能力,接入自动化工作流与AI Agent,推动AI视频创作向完整系统升级。

昆仑万维推出AI短剧创作平台「天工短剧工作台」

昆仑万维推出「天工短剧工作台」 ,基于多智能体协同,融合Seedance、SkyReels、可灵、Vidu四大视频模型。平台提供传统分镜与智能分镜两种模式,支持资产提取、角色多视图推理、一键成片,实现”输入剧本→直达成片”的工业化流程,解决AI短剧创作周期长、成本高、一致性差等痛点。

©️版权声明:若无特殊声明,本站所有文章版权均归AI智库原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

相关文章

发表评论