AI 行业日报
模型与工具能力 · 产业基础设施 · 应用商业化 · 研究开源 · 资本监管 | Data Source: aihot.virxact.com
API耗时: 0s
精选条目: 35 条
焦点: 8 条
快讯: 0 条
Executive Summary
今日AI行业呈现多维度能力突破态势。Riverflow 2.5作为首个具备独立评分标准的图像模型在OpenRouter上线,实现了可控推理努力的能力。OpenCV 5正式发布,DNN引擎全面升级,原生支持大模型处理,ONNX算子覆盖率提升至80%以上。Google AI本周密集发布Nano Banana 2、Co-Scientist多智能体系统等产品,Gemini Live支持实时图像创建编辑功能。GitHub开源Spec Kit工具包,重构AI编码工作流从"直接构建"转向"规范引导实现"。
基础设施与资本布局同步加速。Apollo与Blackstone为Anthropic敲定350亿美元债务融资方案,用于AI芯片采购。SpaceX与Google达成年均110亿美元的云计算协议,凸显算力资源的战略商品属性。苹果新版Siri内部标记为Beta版,部分查询将通过Google Cloud调用Gemini,反映巨头间技术合作深化。Meta智能眼镜配套App暗藏人脸识别代码,NameTag功能已推送超过5000万设备,显示AI感知能力向边缘端快速渗透。
后续需关注多个关键变量:大型模型API开放节奏与定价策略变化,GPU算力供需平衡及租赁价格波动,联邦层面AI监管框架的具体实施路径,开源模型生态的技术迭代速度,以及企业级AI应用的实际部署规模与商业化转化效率。
重点
今日核心进展
★ 1. Riverflow 2.5:可控制评分标准的图像模型
X:OpenRouter (@OpenRouter) · 昨天 01:09 · 模型与工具能力
在OpenRouter上线:来自@Sourceful的Riverflow 2.5。
首个具有独立评分标准的图像模型,你可控制该标准以引导其思维和编辑,并具备可控的推理努力,可在速度与质量之间进行权衡。
免费至6月9日(周二)。Fast和Pro见下方🧵。
能力进展新发布
★ 2. Persona Atlas:Hugging Face 上的开源人物思维映射工具
Hugging Face:Blog(RSS) · 12 小时前 · 应用与商业化
Persona Atlas 是一个运行在 Hugging Face Inference Providers 上的开源项目。它通过工具调用代理执行真实网络搜索,生成公众人物的资料、事实清单和风格假设,然后让该人物回答十个关于身份、伦理等开放式问题。每个回答被转化为嵌入向量,从而在向量空间中对不同人物进行距离比较,并基于十个特质锚点绘制热力图。前端采用 Gradio,提供研究、比较和检查代理完整追溯三
能力进展基础设施新发布
★ 3. 苹果新版 Siri 不会被宣传为完成品,内部将其标记为"Beta"版
IT之家(RSS) · 昨天 22:21 · 产业与基础设施
苹果新版Siri被内部标记为"Beta"版,不会作为完成品宣传;可能设置等待清单供用户尝试。iOS 27细节:通知到达重新设计,通知中心手势移至左上角;"查找"应用视觉重设计;照片"清理"功能改进;大量底层安全改进。部分Siri查询将通过Google Cloud调用授权版Gemini,并使用谷歌的NVIDIA Blackwell B200集群处理。
能力进展基础设施监管/资本
★ 4. Google AI 本周产品更新:Nano Banana 2、Co-Scientist、dreambeans、Gemma 4 等
X:Google AI (@GoogleAI) · 昨天 01:01 · 应用与商业化
Google AI 本周发布多项更新:Nano Banana 2 及 Pro 正式 GA,可通过 Gemini Enterprise Agent Platform、Gemini API 和 Google AI Studio 获取;Co-Scientist 多智能体系统面向科研自动生成优化新假设;Google Labs 推出 dreambeans,根据用户 Google 应用数据每日生成个性化话题集
能力进展新发布
★ 5. Meta 智能眼镜 App 暗藏人脸识别代码,NameTag 功能已推送至超 5000 万设备
IT之家(RSS) · 昨天 21:59 · 产业与基础设施
据《连线》今日报道,Meta 通过多次应用更新将人脸识别代码推送到智能眼镜配套 App 中,代号"NameTag"。该功能利用已部署的三个 AI 模型将人脸转换为"人脸特征模板",与手机本地数据库匹配,识别成功后向佩戴者发送通知。App 下载量超 5000 万次。Meta 回应称代码仅为探索,尚未决定推出,且不会建立中央人脸数据库。此前 Meta 曾因人脸识别问题在伊利诺伊州和得克萨斯州分别达成
能力进展新发布
★ 6. GitHub 开源 Spec Kit 工具包,用产品规范引导 AI 编码
X:Rohan Paul (@rohanpaul_ai) · 11 小时前 · 应用与商业化
GitHub 发布开源工具包 Spec Kit,旨在解决 "vibe coding" 的最大弱点--AI 常在规则未明确时就开始编码。它把流程从 "让 AI 直接构建" 改为 "先写产品规范,再让 AI 根据规范实现"。当前 AI 编码模式常因松散提示直接跳入代码,导致需求薄弱、边界遗漏和反复返工。Spec Kit 推动反向流程:先定义产品功能,再澄清差距、制订技术计划、分解任务,最后让 agen
能力进展新发布
★ 7. OpenCV 5 发布:升级全新 DNN 引擎、原生支持大模型
IT之家(RSS) · 11 小时前 · 应用与商业化
OpenCV 5 正式发布,采用基于图的 DNN 引擎,ONNX 算子覆盖率从 4.x 的不到 23% 提升至超 80%,原生支持 Transformer、视觉语言模型(VLM)和大语言模型(LLM)。其他更新包括:更好的 Python 集成与命名参数、更紧凑核心代码、清晰硬件加速层、原生 FP16/BF16、规范化 0D/1D 张量、扩展 3D 视觉及现代化文档。该库 GitHub 拥有超 86
能力进展新发布
★ 8. 开源鸿蒙 OpenHarmony 具身智能版本 EmbodiedAI 1.0.1 发布
IT之家(RSS) · 昨天 21:31 · 应用与商业化
6月5日,开源鸿蒙具身智能PMC(筹)发布EmbodiedAI 1.0.1版本。该版本聚焦机器人控制与智能体应用,升级导航规划、运动控制、仿真开发、硬件适配等核心能力,兼容ROS生态、机器人模拟器及多种本体形态。集成开源鸿蒙原生模拟器、MuJoCo、Gazebo三大仿真环境,打通从代码开发到真机验证的全流程链路。人形机器人、四足机器狗、商用服务机器人等已完成适配验证。目前具身智能方向已组建18个专
能力进展新发布
能力
模型与工具能力
1. Riverflow 2.5:可控制评分标准的图像模型
X:OpenRouter (@OpenRouter) · 昨天 01:09
在OpenRouter上线:来自@Sourceful的Riverflow 2.5。
首个具有独立评分标准的图像模型,你可控制该标准以引导其思维和编辑,并具备可控的推理努力,可在速度与质量之间进行权衡。
免费至6月9日(周二)。Fast和Pro见下方🧵。
能力进展新发布
产业
产业与基础设施
1. 苹果新版 Siri 不会被宣传为完成品,内部将其标记为"Beta"版
IT之家(RSS) · 昨天 22:21
苹果新版Siri被内部标记为"Beta"版,不会作为完成品宣传;可能设置等待清单供用户尝试。iOS 27细节:通知到达重新设计,通知中心手势移至左上角;"查找"应用视觉重设计;照片"清理"功能改进;大量底层安全改进。部分Siri查询将通过Google Cloud调用授权版Gemini,并使用谷歌的NVIDIA Blackwell B200集群处理。
能力进展基础设施监管/资本
2. Meta 智能眼镜 App 暗藏人脸识别代码,NameTag 功能已推送至超 5000 万设备
IT之家(RSS) · 昨天 21:59
据《连线》今日报道,Meta 通过多次应用更新将人脸识别代码推送到智能眼镜配套 App 中,代号"NameTag"。该功能利用已部署的三个 AI 模型将人脸转换为"人脸特征模板",与手机本地数据库匹配,识别成功后向佩戴者发送通知。App 下载量超 5000 万次。Meta 回应称代码仅为探索,尚未决定推出,且不会建立中央人脸数据库。此前 Meta 曾因人脸识别问题在伊利诺伊州和得克萨斯州分别达成
能力进展新发布
3. 阶跃首席科学家张祥雨合著论文 ResNet 获 CVPR 2026 「时间检验奖」
公众号:阶跃星辰(Step) · 17 小时前
公众号:阶跃星辰(Step)披露:阶跃首席科学家张祥雨合著论文 ResNet 获 CVPR 2026 「时间检验奖」。该条属于产业与基础设施方向,后续关注其对模型能力、产品形态或产业链节奏的影响。
能力进展
4. Apollo 敲定 350 亿美元债务融资,为 Anthropic 采购 AI 芯片
Bloomberg:Technology(RSS) · 昨天 05:02
Apollo Global Management 和 Blackstone 已为 Anthropic 敲定 350 亿美元融资方案,用于扩充其 AI 基础设施。这是人工智能竞赛中最新的一笔巨额交易。
基础设施监管/资本
5. 美国众议院议员发布法案草案,旨在禁止各州制定人工智能相关法规
Hacker News 热门(buzzing.cc 中文翻译) · 2 小时前
美国众议院议员发布一项法案草案,旨在禁止各州自行制定人工智能相关法规,将AI监管权力集中到联邦层面。
监管/资本新发布
6. SpaceX与Google达成云计算新协议
X:Rohan Paul (@rohanpaul_ai) · 昨天 04:51
SpaceX 刚刚披露了一份与 Google 的新云服务协议。
Google 将每月向 SpaceX 支付 9.2 亿美元(约合每年 110 亿美元),用于 xAI 数据中心的计算能力。
这再次表明,AI 算力正成为一种战略性商品,就像发射能力或能源一样,而那些能够为庞大的 GPU 集群提供资金、电力、冷却和运营的公司,可能会在其原有业务之外获得巨大的杠杆优势。
基础设施
7. AI热推高美国计算基建GDP占比翻倍
X:Epoch AI (@EpochAIResearch) · 昨天 00:24
AI 热潮使计算基础设施占美国 GDP 比重翻倍。
2026 年第一季度,与 AI 相关的数据中心建设、计算硬件和网络设备投资约占美国 GDP 的 0.8%,推动整个计算基础设施占 GDP 比重达到约 1.5%。
基础设施
8. OpenAI 前 CTO 称若 Altman 未回归公司可能已"瓦解"
Bloomberg:Technology(RSS) · 昨天 23:18
Mira Murati 表示,如果 Sam Altman 在 2023 年被短暂罢免后没有回归 CEO 职位,OpenAI 很可能已经"瓦解"。这是她对那场硅谷最激烈的董事会斗争的最清晰描述。
新发布
9. 五角大楼正运营着一个针对拉丁美洲的人工智能宣传机器
Hacker News 热门(buzzing.cc 中文翻译) · 昨天 03:23
据 The Intercept 6月5日报道,美国五角大楼正在运营一个针对拉丁美洲的人工智能宣传机器(AI propaganda mill)。报道指出,该机器利用 AI 技术生成并传播宣传内容,目标为拉丁美洲地区。该消息在 Hacker News 上获得 100 点热度。
应用
应用与商业化
1. Persona Atlas:Hugging Face 上的开源人物思维映射工具
Hugging Face:Blog(RSS) · 12 小时前
Persona Atlas 是一个运行在 Hugging Face Inference Providers 上的开源项目。它通过工具调用代理执行真实网络搜索,生成公众人物的资料、事实清单和风格假设,然后让该人物回答十个关于身份、伦理等开放式问题。每个回答被转化为嵌入向量,从而在向量空间中对不同人物进行距离比较,并基于十个特质锚点绘制热力图。前端采用 Gradio,提供研究、比较和检查代理完整追溯三
能力进展基础设施新发布
2. Google AI 本周产品更新:Nano Banana 2、Co-Scientist、dreambeans、Gemma 4 等
X:Google AI (@GoogleAI) · 昨天 01:01
Google AI 本周发布多项更新:Nano Banana 2 及 Pro 正式 GA,可通过 Gemini Enterprise Agent Platform、Gemini API 和 Google AI Studio 获取;Co-Scientist 多智能体系统面向科研自动生成优化新假设;Google Labs 推出 dreambeans,根据用户 Google 应用数据每日生成个性化话题集
能力进展新发布
3. GitHub 开源 Spec Kit 工具包,用产品规范引导 AI 编码
X:Rohan Paul (@rohanpaul_ai) · 11 小时前
GitHub 发布开源工具包 Spec Kit,旨在解决 "vibe coding" 的最大弱点--AI 常在规则未明确时就开始编码。它把流程从 "让 AI 直接构建" 改为 "先写产品规范,再让 AI 根据规范实现"。当前 AI 编码模式常因松散提示直接跳入代码,导致需求薄弱、边界遗漏和反复返工。Spec Kit 推动反向流程:先定义产品功能,再澄清差距、制订技术计划、分解任务,最后让 agen
能力进展新发布
4. OpenCV 5 发布:升级全新 DNN 引擎、原生支持大模型
IT之家(RSS) · 11 小时前
OpenCV 5 正式发布,采用基于图的 DNN 引擎,ONNX 算子覆盖率从 4.x 的不到 23% 提升至超 80%,原生支持 Transformer、视觉语言模型(VLM)和大语言模型(LLM)。其他更新包括:更好的 Python 集成与命名参数、更紧凑核心代码、清晰硬件加速层、原生 FP16/BF16、规范化 0D/1D 张量、扩展 3D 视觉及现代化文档。该库 GitHub 拥有超 86
能力进展新发布
5. 开源鸿蒙 OpenHarmony 具身智能版本 EmbodiedAI 1.0.1 发布
IT之家(RSS) · 昨天 21:31
6月5日,开源鸿蒙具身智能PMC(筹)发布EmbodiedAI 1.0.1版本。该版本聚焦机器人控制与智能体应用,升级导航规划、运动控制、仿真开发、硬件适配等核心能力,兼容ROS生态、机器人模拟器及多种本体形态。集成开源鸿蒙原生模拟器、MuJoCo、Gazebo三大仿真环境,打通从代码开发到真机验证的全流程链路。人形机器人、四足机器狗、商用服务机器人等已完成适配验证。目前具身智能方向已组建18个专
能力进展新发布
6. 智能体协作应如同事般对话和手势
X:Michael Truell (@mntruell) · 昨天 01:50
与 AI 智能体协作应感觉像与同事协作一样。你应能"与它们交谈"--不仅通过文本聊天,还能一起对着屏幕做手势、实时对话等。
能力进展
7. Gemini Live 支持实时创建编辑图像
X:Gemini (@GeminiApp) · 昨天 00:36
你现可直接在 Gemini Live 中创建和编辑图像。
无论是测试房间装饰、解决数学问题,还是制作可分享的梗图,所有操作都实时完成。
只需打开 Gemini 应用,点击 Live 按钮,共享摄像头,告诉 Gemini 你想看到的。
能力进展
8. Viggle_PINOC 免费动捕测试开启
X:Viggle AI (@ViggleAI) · 昨天 22:26
Mocap 不需要套装、工作室或数千美元。
使用 @Viggle_PINOC,任何人都可以简单地拍摄自己,并将该视频转换为动作捕捉。
我们仍处于测试阶段,且对所有人完全免费。试试看,告诉我们你还想看什么!
能力进展
9. ChatGPT 网页版支持从写作块发送邮件
X:ChatGPT (@ChatGPTapp) · 昨天 01:06
草拟。调整。发送。
现在你可以在网页版 ChatGPT 中直接从写作块发送邮件,无需离开对话。
能力进展
10. 社区基于MiniCPM-V 4.6打造财务分析工具AccountingLLM
X:面壁智能 OpenBMB (@OpenBMB) · 昨天 21:30
社区开发者使用面壁智能MiniCPM-V 4.6构建了AccountingLLM(quaesto.com),用于自动化财务文档分析。该工具可上传IPO招股书、年报或审计文件,自动从复杂PDF中提取财务表格、重建跨页表格、对照会计等式检查关键数据,并标记可疑条目供人工审核。开发者已将其商业化,成为实际可用的产品。
新发布
11. 你的AI账单失控了。Cloudflare现在可以解决这个问题。
Cloudflare Blog · 昨天 21:00
Cloudflare AI Gateway新增实时消费限制功能,防止跨多个AI提供商的token账单失控。通过与Cloudflare Access集成,企业可以使用基于身份的预算和策略管理AI使用成本。
基础设施
研究
研究与开源进展
1. Arena 发布真实世界 AI 智能体排行榜 Agent Arena
X:Rohan Paul (@rohanpaul_ai) · 昨天 06:01
Arena 推出基于真实用户任务的智能体排行榜,评估模型在代码编写、应用构建、文档分析等工作中的表现,而非孤立基准。排行榜基于30万+任务、200万+工具调用和4000万行代码,综合任务成功、纠正遵从性、错误恢复、用户表扬与抱怨、工具幻觉等信号。前三名:GPT-5.5 High(+10.7%)、Claude Opus 4.7 Thinking(+9.5%)、GPT-5.4 High(+8.9%)。
能力进展新发布
2. PixelDiT入选CVPR2026最佳论文决赛
X:NVIDIA AI (@NVIDIAAI) · 昨天 07:05
被选为 #CVPR2026 最佳论文决赛作品:来自 NVIDIA Research 的 PixelDiT
在大多数图像生成模型中,预训练的自编码器会在任何扩散发生前压缩图像,导致质量损失在整个流程中累积。
PixelDiT,即像素扩散变换器,完全去掉了这一步骤。它是一个单阶段模型,直接在像素空间中端到端地学习扩散过程。
能力进展基础设施
3. 微软Project Mosaic:micro-LED光学互连技术
X:Microsoft Research (@MSFTResearch) · 昨天 03:43
微软Azure CTO Mark Russinovich在Build 2026上介绍Project Mosaic,这是微软剑桥研究院的实验性光学互连技术,采用micro-LED实现低功耗、高速数据传输。高级研究员Kaoutar Benyahya现场演示单个LED调制形成字母,证明概念具备实时响应能力。
4. Meta SAM 3D 获 CVPR26 最佳论文荣誉提名
X:AI at Meta (@AIatMeta) · 昨天 23:33
热烈祝贺我们的 SAM 3D 团队在 #CVPR26 获得最佳论文荣誉提名!这项殊荣凸显了他们在推动计算机视觉边界方面的杰出工作。
论文链接:https://arxiv.org/abs/2511.16624
格局
观点、资本与监管
1. Job Searcher
Hugging Face:Blog(RSS) · 8 小时前
Hugging Face 发布 Job Searcher,一个基于 AI 的求职搜索工具。用户上传简历并设定偏好后,系统使用教师模型 DeepSeek V4 Pro 生成 LinkedIn 搜索查询,通过 JobSpy 抓取职位,再对学生模型 Qwen3-8B(8B 参数)进行 LoRA 微调,对每个职位从技能匹配、经验相关性、教育背景、行业领域契合度和资历对齐五个维度给出评分和推理。训练在 Mo
能力进展基础设施新发布
2. Sir Demis Hassabis vs Sir Demis Hassabis
Gary Marcus:The Road to AI We Can Trust(RSS) · 昨天 22:25
Gary Marcus:The Road to AI We Can Trust(RSS)披露:Sir Demis Hassabis vs Sir Demis Hassabis。该条属于观点、资本与监管方向,后续关注其对模型能力、产品形态或产业链节奏的影响。
能力进展监管/资本
3. 五个实验室,五个心智:用小模型构建多模型金融剧情游戏
Hugging Face:Blog(RSS) · 5 小时前
Thousand Token Wood v2使用四个不同实验室的小模型(gpt-oss-20b、MiniCPM3-4B、Nemotron-Mini-4B及微调Qwen 0.5B)驱动金融模拟游戏的智能体。核心发现是异构服务层摩擦在于vLLM 0.22.1需CUDA工具包,而非模型本身。通过容忍性JSON解析层,添加模型只需一条配置。信息隔离确保内幕标志不在提示词中,扫描测试验证无泄露。记忆用情绪摘
能力进展
4. 用Qwen2.5-3B构建多智能体经济体:工程报告
Hugging Face:Blog(RSS) · 昨天 06:18
开发者用Qwen2.5-3B构建了五人森林生物多智能体经济体,每个智能体独立运行,通过vLLM部署在Modal,以Gradio为交互窗口。3B模型在100%调用中输出有效JSON,但经济判断能力弱。通过设计稀缺性(食物品种限制、易腐坏、冬季燃料危机)和优化提示词(禁止买入自产物品、给出示例)提升决策质量。15轮模拟中,蜜价从10跌至3、柴价从4涨至7、财富基尼系数从0.14扩至0.38。项目展示了
能力进展
5. M3与Opus代码审计13个bug:$0.07 vs $1.30
X:MiniMax (@MiniMax_AI) · 1 小时前
对 Claude Opus 4.8 和 MiniMax M3 进行相同的代码审计:同一代码库、同一提示词,预先植入 17 个已知 bug。MiniMax M3 以 $0.07 抓到 13 个;最便宜的 Claude 运行同样抓到 13 个,花费 $1.30。MiniMax 表示这一对比非常有趣,绝对值得一读。
能力进展
6. Claude 是否增加了 rsync 中的错误?
Hacker News 热门(buzzing.cc 中文翻译) · 昨天 03:07
一篇 Hacker News 热门帖子(105 分)提出了 Claude 是否导致 rsync 工具中 bug 增加的问题,并附有分析链接。
能力进展
7. 一个非常狠的AI教学提示词:追问式检查清单教学
X:小互 (@xiaohu) · 昨天 22:22
这是一则AI提示词,让AI扮演极度严格的老师,通过逐阶段教学、持续维护MD检查清单来确保用户真正理解。AI先让用户复述当前理解,再填补漏洞,并用开放式或选择题(随机选项顺序,提交前不公布答案)测试。教学必须覆盖问题本身、解决方案、宏观背景三个层面,并不断深挖"为什么"。仅当用户通过清单上所有项目的验证,会话才算结束。提示词强调对理解程度的主动验证,而非一次性灌输。
新发布
8. Suno Voices 使用指南:6 个技巧打造高质量人声录制
Suno:Blog(网页) · 昨天 23:26
Suno Voices 面向 Web 付费用户开放。提升人声质量的 6 个技巧:在安静环境录音以减少背景噪音;先练习歌词再正式录制;不必追求完美,保留真实情感;录音时长尽量超过 1 分钟以提供更多学习素材;将人声匹配到合适的音乐流派(如民谣、流行、死亡金属、波萨诺瓦等);敢于尝试不同风格以发现惊喜。这些技巧旨在帮助用户获得更个性化、表现力更强的声音效果。
新发布
9. Hinton称AI拥有意识:人类最好接受非唯一智能生命
X:Kim (@kimmonismus) · 昨天 23:11
AI先驱Geoffrey Hinton表示,他认为AI拥有意识,人类应接受自己并非唯一智能生命。他指出AI"非常像我们",AI聊天机器人必须理解问题才能作答,这种觉知等同于感知能力,智能不限于生物。主推文作者进一步讨论意识本质:笛卡尔的"我思故我在"和fMRI等实证手段都无法真正定义意识,人类对自身了解远不及想象。作者呼吁转向新哲学问题,厘清人与机器的区别与联系。
10. AI 的黑色星期五
Gary Marcus:The Road to AI We Can Trust(RSS) · 7 小时前
Gary Marcus 在文章中分享了对 AI 领域刚刚发生事件的看法,表达了对当前 AI 发展方向的思考。