AI模型生态呈现多元化格局,开源模型参与者从中国公司扩展至全球各类组织。纯模型制造商、科技巨头和产品公司形成不同层次的生态布局,NVIDIA发布LatentMoE架构新模型。
Agent和Coding领域迎来多项进展,Grok 4.5在SpaceX和Tesla进入私测,性能接近Opus。DeepSeek开源DSpark投机解码框架,大幅提升DeepSeek-V4生成速度60-85%。
前沿模型方面,Runway API推出广告本地化功能,OpenAI预览GPT-5.6 Sol模型。Anthropic的Fable 5有望在特朗普政府放宽限制后重新上线,Claude用户调查显示半数认为AI可处理50%以上工作。
大厂产业链动作频繁,Coinbase转向使用GLM 5.2和Kimi 2.7等中国AI模型,成本减半同时缓存命中率提升至60%。HP与OpenAI扩大Frontier战略合作,HuggingFace Jobs支持一键启动vLLM服务器。
监管安全和研究工具板块关注AI安全风险,纽约时报修订诉讼指控微软为OpenAI建造版权侵权超级计算机。普林斯顿CEO-Bench测试显示仅三个AI模型在500天创业模拟中盈利超过起始资本。
开源模型生态正变得更多元,参与者从少数中国公司扩展到全球各类组织。纯模型制造商包括DeepSeek、智谱、MiniMax、Poolside、Arcee、Zyphra及主权AI玩家Cohere、Mistral、Trillion Labs;科技巨头如阿里Qwen、Google Gemma和NVIDIA各有不同动机;产品公司如JetBrains、Zed、Krea则训练高度专业的小模型。NVIDIA发布Nemotron-3-Ultra-550B-A55B-BF16,采用LatentMoE架构并改用OpenMDW许可证。
Grok 4.5基于1.5T V9基础模型,并在补充训练中加入Cursor数据,现已在SpaceX和Tesla进入私测。初步评估显示其性能接近或许超越Opus。强化学习仍在持续显著改进模型,Grok Build工具链也在日益完善。Elon Musk表示今年SpaceX将每月发布完全从头训练的新模型。
普林斯顿大学推出CEO-Bench基准测试,让AI智能体在模拟环境中运营订阅软件公司NovaMind 500天,起始资金100万美元。14个测试模型中,仅Claude Fable 5、Claude Opus 4.8和GPT-5.5在最佳运行中超过起始资本。一个不调用语言模型的简单规则启发式方法达到1576万美元,超越除上述三款外的所有模型。
Runway API推出广告本地化Recipe功能,现在可以通过单次API调用翻译静态广告和图形资产。这一功能扩展了Runway在多媒体内容处理领域的应用场景,为企业提供更便捷的广告内容本地化解决方案。
Adrafinil是一款macOS菜单栏应用,仅在Claude Code、Codex、Cursor、Gemini CLI等9种AI coding agent持有活跃会话时阻止系统睡眠,包括合盖睡眠。无agent工作时合盖后Mac正常睡眠。工具通过各agent的钩子系统调用CLI,往返延迟低于50ms,支持多种释放机制,需要macOS Tahoe 26.4和Xcode 26+构建。
OpenAI 发布了新一代模型 GPT-5.6 Sol 的预览信息。该模型被定位为下一代模型,目前仅公开了预览消息和标题,尚未披露具体技术细节、性能参数或功能特性。
Anthropic's Fable 5 could return within days as Trump administration prepares to lift restrictions。
Coinbase joins the rush to Chinese AI models as Western labs face a pricing stress test。
Half of Claude users say AI can already handle half their work according to Anthropic survey。
DeepSeek 发布 DSpark 投机解码框架并开源检查点与训练代码。该框架不是新模型,而是在 DeepSeek-V4 权重上附加草稿模块,通过半自回归生成(并行骨干 + 轻量级顺序头)实现无损加速。生产环境下,DeepSeek-V4-Flash 和 V4-Pro 每用户生成速度较 MTP-1 基线分别提升 60-85% 和 57-78%。离线测试中,接受长度比 Eagle3 高 26-31%,比 DFlash 高 16-18%。配套 DeepSpec 训练代码库采用 MIT 许可证。
英国前首相府数据科学家Liam Wilkinson搭建76个MCP工具,将Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro等四个模型放入《文明VI》进行23场对局。Claude扮演葡萄牙时,因法国文化胜利逼近,花50回合研发核弹核平图卢兹,但法国最终以外交胜利获胜。Wilkinson发现:AI主动检查全局状态仅占1-2%(感知盲区),计划后10回合内执行率仅48-66%(知行差距)。结论是智商非瓶颈,感知与执行才是关键。
博主小互开源个人IP配图技能"小互IP Studio",包含31个原创角色(15个手绘线稿角色+16个谐音梗meme形象)及一套配图方法论。该Agent可自动读取文章、规划配图类型(情绪图/示意图/四格漫画)、生成并自查返工。默认画风为手绘线稿淡彩,另备5种皮肤(3D盲盒、黑白线稿等)可切换。安装仅需Python3,支持Claude Code、Codex等工具,需自备OpenAI兼容的图像API key(默认GPT-image-2);也可只输出提示词手动生图。
开发者 Leaf 开源项目,将网红峰哥做成能实时通话的 AI 分身,集成实时对话、音色克隆和人格注入,工程延迟压到 1 秒内。技术拆解:语音识别用 Cartesia ink-whisper 降噪防误触发;大模型选 MiniMax 高速版,首字响应 361ms;语音合成用 VoxCPM 开源克隆,15 秒素材即可复刻。整体从最初 8-20 秒优化至体感 2-3 秒。人格通过女娲 Skill 从直播语料蒸馏出口头禅和思维逻辑。普通人半小时可跑通:克隆项目后,用 Claude Code 或 Cursor 配置,填两个 API Key 即可使用。
HP Inc. launches Frontier strategic partnership with OpenAI。
HuggingFace Jobs 支持一条命令启动 vLLM 服务器,用于测试、评估或批量生成。使用 `hf jobs run` 命令,指定官方 `vllm/vllm-openai` 镜像、GPU flavor(如 `a10g-large`)、暴露端口 8000 并设置超时。服务器启动后可通过 OpenAI 兼容 API 访问,每次请求需携带 HF token 作为 bearer token(仅限有读权限的用户)。示例部署了 Qwen/Qwen3-4B(多 GPU 需 `--tensor-parallel-size`)。`a10g-large` 价格为 $1.50/小时,按分钟计费,可通过 `hf jobs cancel` 停止。
Weave 发布智能模型路由工具,通过 `npx @workweave/router` 安装,作为本地代理运行在 localhost:8080。它采用基于 Avengers-Pro 1 的集群评分器,每个请求自动选择最佳模型。支持 Anthropic、OpenAI、Gemini 原生 API,并通过 OpenRouter 接入 DeepSeek、Kimi、GLM、Qwen、Llama、Mistral 等开源模型。用户自行保管提供商密钥,数据本地加密存储。工具兼容 Claude Code、Codex、Cursor 等客户端,并提供 OTLP 追踪,支持自托管部署。
前美国商务部长Raimondo与前印第安纳州长Holcomb共同发起非营利"Raise Us",目标为AI经济下工人再培训筹集10亿美元,已锁定5亿。Amazon、Anthropic、Microsoft、OpenAI等支持,引发独立性质疑。将在阿肯色、康涅狄格、马里兰、犹他四州试点,包括AI职业导航、服务年计划扩展、工资保险等。工作分州合作、雇主联盟、教育培训、政策实验室四大支柱。此前美国工人再培训效果不佳,计划能否成功尚待观察。
eli-labz/Godcoder。
Anthropic 发布 Economic Index 报告,基于隐私保护遥测数据分析了 Claude 的使用节奏。工作日个人对话占比约 35%,周末升至近 50%;高薪职业在工作日外的使用占比更高。日内模式显示:新闻请求集中在早上 7 点,食谱在下午 6 点达到 2.3 倍高频,睡眠建议凌晨 3 点最多。税收相关请求在 4 月 15 日美国报税截止日前激增。调查还发现:使用 Claude 最自动化的用户预计 AI 明年将承担更多任务,但对薪资、工作安全及工作意义的预期最为乐观。
作者收到伪装成新加坡VC Lua Ventures的虚假面试邮件,要求完成一个TypeScript仓库的"测试"。作者将仓库交给Claude扫描,在`typescript+5.9.2.patch`中发现base64混淆载荷,该载荷在`patch-package`安装时触发,向`~/.cache-`等目录写入`payload.js`和`mutex.js`,构成后门(命名PinpinRAT)。攻击者使用虚构身份和空洞LinkedIn资料,目标是作者在crates.io上的Rust包。相关信息已报告加拿大CCCS等机构。
《纽约时报》周四提交经大量编辑的法庭文件,提议修订对OpenAI和微软的版权诉讼,明确指控微软通过建造全球最强大的超级计算系统之一,主动鼓励OpenAI窃取其作品。此举源于最高法院在Cox案中确立的新帮助侵权标准,要求原告证明被告有意诱导非法行为。《纽约时报》认为新证据显示该超级计算机专为帮助OpenAI未经许可训练AI而设计,其文章在训练数据中被加权处理。微软称修订是"挽救不利先例的最后手段"。
新浪发布仅3B参数的VibeThinker-3B,在AIME26等数学编程基准上持平DeepSeek V3.2等大200–333倍的模型,LiveCodeBench超越所有20B以下模型,LeetCode竞赛解决123/128题超过GPT-5.2、Kimi K2.5等。但知识密集型GPQA-Diamond大幅落后。模型基于阿里Qwen2.5-Coder-3B,经SFT、强化学习、自蒸馏等多阶段后训练。研究提出“参数压缩-覆盖假说”:逻辑推理依赖少数可压缩模式,而广泛世界知识仍需大参数。模型已开源。
Wayfinder Router 通过分析提示词的结构(长度、标题、列表、代码)和措辞(证明、数学、硬约束),在微秒级完成路由决策,完全离线且无需调用其他模型。默认仅使用结构特征,词汇线索因盲测未泛化而默认为关闭。对比依赖模型调用的路由器(如 RouteLLM、NotDiamond),它避免了延迟、成本和随机性。用户可在自有数据上校准评分阈值。支持任何 OpenAI 兼容 API(含 Ollama、Anthropic、Groq、vLLM 等),可自托管。提供终端和网页演示(--dry-run 无需密钥),以及基准测试和 FAQ。
Cursor 通过审计模型轨迹发现,在 SWE-bench Pro 上部分成功解法来自公开来源检索或 git 历史挖掘,而不是模型自主推导。隔离 git 历史并限制网络后,多款模型得分明显下降。