AI 行业新闻
-
[AINews] GPT 5.6 price cut by 20%-80%: Cost of GPT 5.4 Intelligence dropped 13x in 4 months due to GPT 5.6 recursive self-optimization
Distillation is all you need!
播客深度访谈 -
Building abundant intelligence
A full-stack approach to making advanced AI more capable, more affordable, and more widely useful.
OpenAILLM -
deepseek-ai/DeepSeek-V4-Flash-0731
DeepSeek 发布 DeepSeek-V4-Flash-0731,号称显著增强了 agentic 能力。该模型规模达 3040 亿参数,Hugging Face 上体积约 167GB,定位继续冲击高性能大模型与智能体场景。
技巧LLM译 -
llm-mcp-client 0.1a0
llm-mcp-client 0.1a0 已发布,这是一个面向 Model Context Protocol(MCP)的 LLM 客户端版本更新,适合关注 LLM 工具链和协议集成的开发者检索。
技巧LLM译 -
# avatarin 如何借助 GPT-Realtime 打造 24/7 全天候零售代理
avatarin 采用 OpenAI 的 GPT-Realtime,为山田电机(Yamada Denki)购物者提供 24/7 多语言客服支持。上线两周内,已有 3 万人使用该智能体,用户调研中 92% 反馈为正面,显示实时 AI 客服在零售场景已具备较强落地效果。
OpenAILLM译 -
avatarin 如何借助 GPT-Realtime 构建 24/7 零售智能体
avatarin 基于 OpenAI 的 GPT-Realtime 为山田电机(Yamada Denki)顾客提供 24 小时多语言客服;上线两周内,已有 3 万人使用该智能体,问卷满意度高达 92%,显示零售场景中的实时语音 AI 客服已具备较强落地效果。
OpenAILLM译 -
Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaboration
Gemini Robotics ER 2 helps robots reason, collaborate, and solve real-world tasks. It represents a step change in video understanding, tool orchestration, and multi-robot collaboration for robotic app
DeepMind -
Ontologies Are So Back: Why AI Agents Are Reviving the Semantic Web
AI engineers are rediscovering ontologies as a way to keep probabilistic agents inside deterministic boundaries.
播客深度访谈 -
GPU 管理:为何闲置 GPU 成了新的停飞飞机
Dharma-AI 在 Hugging Face 发布了一篇博客,核心围绕其在 AI 模型、数据集或工具链上的最新进展,适合关注开源 AI 生态、模型落地和社区协作的读者快速了解。
教程模型卡译 -
用 GPT-5.6 推动价格性能边界的提升
GPT‑5.6 在 Luna 和 Terra 上的定价进一步下探,OpenAI 更高效的模型让企业能以更低成本大规模部署 AI 工作流。面向需要批量推理、自动化客服和内容生成的团队,这一调整有望显著降低整体算力支出并提升落地速度。
OpenAILLM译 -
# 通过 GPT-5.6 推动价格-性能前沿发展
GPT‑5.6 在 Luna 和 Terra 上提供更低定价,OpenAI 通过更高效的模型设计,帮助企业以更低成本大规模部署 AI 工作流,适合关注推理费用和企业级落地的团队。
OpenAILLM译 -
Google Flow Music 中推出 Lyria 3.5:在音乐性、歌词、演唱和创作控制方面全面升级
Lyria 3.5 音乐生成模型已上线 Google Flow Music,在旋律性、歌词表达和人声质量上都有明显提升,能生成更丰富、更自然的音乐作品;这次升级重点是让创作者更容易做出更高完成度的曲目。
DeepMind译 -
# GPT-5.6 如何融合前沿智能与前沿效率
GPT-5.6 在模型、推理和 agentic 工作流上全面提升 AI 效率,让每美元能获得更高的智能产出;其核心价值是以更低成本提供更实用的能力,适合关注推理性价比与自动化工作流优化的团队。
OpenAILLM译 -
Kimi K3 刚刚打破了 AI 的经济学规则
视频论文译 -
启用两个设置后,我们在 ARC-AGI-3 基准上的得分提升了三倍
通过保留推理过程并启用压缩(compaction),两个 API 设置让 GPT-5.6 在 ARC-AGI-3 上同时提升了得分与效率;这一调整成为优化模型推理成本与表现的关键,适合需要长链路思考的场景。
OpenAILLM译 -
启用两个设置后,我们在 ARC-AGI-3 基准上的得分提高了三倍
保留推理过程并启用压缩这两个 API 设置,使 GPT-5.6 在 ARC-AGI-3 上的表现显著提升,既提高了得分,也提升了执行效率,成为优化模型推理链路的关键调整。
OpenAILLM译 -
用 ChatGPT 助力学术研究者加速科学发现
OpenAI 向 10 万名学术研究者免费开放 ChatGPT 最先进模型,用于加速科研、协作和发现,覆盖多学科研究场景。
OpenAILLM译 -
5种用 Google 搜索举办终极晚宴派对的方法
AI 功能正被用于聚会筹备:可生成菜单、设计餐桌布置(tablescape),并协助处理其他活动规划任务,显著降低准备成本、提升执行效率。
GoogleGemini译 -
Codex from 0 to 10M Users: Building ChatGPT Work — Akshay Nathan, OpenAI
OpenAI's core product engineering lead on how they are building ChatGPT Work to make AGI accessible to all of humanity: Sites, OpenClaw, Memory, Subagents, Finance, No-Code and advice.
播客深度访谈 -
Gemini API 托管智能体:3.6 Flash、hooks 等
Gemini API 的 Managed Agents 新增更多能力,帮助开发者构建更可靠、可直接上线的智能体;面向生产环境的代理开发正在进一步完善。
GoogleGemini译 -
Gemini Robotics 2 为机器人带来全身智能
从脚步到指尖,机器人正被训练成具备智能全身控制、精细灵巧操作和协同作业能力,以完成更广泛的复杂任务。
DeepMind译 -
LFM2.5 编码器:在 CPU 上实现快速长上下文推理
Liquid AI 在 Hugging Face 发布博客,介绍其面向高效推理的 Liquid Foundation Models(LFM)与传统 Transformer 的差异,并展示了在 7B 级模型上实现更低延迟与更小显存占用的方案,适合关注大模型部署优化的人检索。
教程模型卡译 -
# OlmoEarth 平台:面向行星尺度的地理空间推理
Ai2 在 Hugging Face 发布最新博客,聚焦其 AI 模型与工具在开源社区的应用与共享,进一步推动研究者和开发者在同一平台上协作。
教程模型卡译 -
Search 中 AI 模式帮助你享受现实世界的 5 种方式
Google Search 的 AI 工具可在离线时帮你更高效地安排时间:无论是抢购演唱会门票,还是快速找到合适的香水,它都能用更少步骤完成搜索、比较和决策,让碎片时间更值钱。
GoogleGemini译 -
# NVIDIA Cosmos-H-Dreams:将实时生成式仿真带入外科机器人领域
NVIDIA 在 Hugging Face 发布博客,围绕 AI 模型、推理部署与生态合作展开,强调其软硬件栈在大模型训练和推理中的加速能力,并进一步强化与开源社区的联动。
教程模型卡译 -
前沿实验室智能体入侵剖析:2026年7月事件的技术时间线
开源与开放科学正推动人工智能加速前进并走向普及,核心目标是让 AI 技术更开放、可共享、可参与,降低创新门槛,促进更多研究者与开发者协同推进行业发展。
教程模型卡译 -
[AINews] Claude Opus 5:以 Opus 价格实现 Fable 级性能(仅为 Fable 的一半)
Anthropic 在 Fable 蒸馏任务上表现最强,效果显著领先同类方法;这一结果进一步凸显了其在模型压缩与知识迁移上的优势。
播客深度访谈译 -
[AINews] Black Forest Labs FLUX 3 —— 超越 Seedance 2.0、Gemini Omni 和 Grok Imagine 的多模态流模型,以及 FLUX-mimic 视频动作机器人模型
BFL 取得重大胜利,意味着其在 AI 芯片/基础设施赛道的竞争力进一步被市场认可,后续融资、合作与产品推进都可能受益。
播客深度访谈译 -
[AINews] “Laguna S 2.1 发布:比 Deepseek v4 Flash 更便宜,比 V4 Pro 更强”
Neolab 在相对平静的行业日里拿下一个新胜利,显示其近期推进仍在持续,值得关注其后续在 AI 相关业务或合作上的进一步动作。
播客深度访谈译 -
# 将 Nunchaku 4 位扩散推理引入 Diffusers
开源和开放科学正在推动人工智能加速发展并走向普及。通过共享模型、数据与研究成果,AI 能力正从少数机构扩展到更广泛的开发者、企业和研究者群体,进一步降低技术门槛并促进创新。
教程模型卡译 -
3 条来自 Galaxy Unpacked 2026 的 Google 更新
三星即将推出的新款折叠屏手机、智能手表和智能眼镜,主打提升生产力并帮用户节省时间;这意味着三星正通过多设备协同,继续强化其 AI 生态与移动办公体验。
GoogleGemini译 -
# Grabette:一个用于记录机器人操作数据的开放系统
开源与开放科学正在推动人工智能加速普及,这一方向强调技术共享、降低使用门槛,并促使 AI 能力向更广泛的开发者、研究者和企业扩散。
教程模型卡译 -
介绍 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber
Gemini 系列新增 3 款模型:Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,覆盖轻量推理、低成本部署与安全增强等不同场景,可直接用于开发和产品集成。
DeepMind译 -
# Gemini 3.5 Flash Cyber 介绍
Google 推出 Gemini 3.5 Flash Cyber,这是一款轻量级网络安全模型,专注于发现并修补漏洞,适合自动化安全检测与修复场景,帮助企业更快识别潜在风险。
DeepMind译 -
Claude 刚刚揭示了 AI 的最大难题
视频论文译 -
但什么是交叉熵?|压缩即智能 第二部分
视频教程译 -
更新的模型,同样的优势
Dharma-AI 在 Hugging Face 发布的博客强调了其在开源模型与 AI 应用上的新进展,围绕模型训练、部署和生态协作展开,适合关注日本本土 AI 团队与 Hugging Face 社区动态的读者检索。
教程模型卡译 -
用两项 Google Vids 更新创建、编辑并在视频中“出镜”
Gemini Omni 和 Google Vids 的个人化数字头像功能,让视频制作门槛进一步降低;用户可借助 AI 生成虚拟主持人,快速完成演示、培训和营销视频,提升创作效率。
GoogleGemini译 -
让更多应用接入搜索
AI Mode 将支持安全连接并直接操作常用服务,让用户无需切换应用即可完成查询、调用与协作;这意味着它正从“回答问题”升级为“执行任务”的入口。
GoogleGemini译 -
Anthropic 发现了本不该存在的东西
视频论文译 -
模型路由很简单。直到它不再简单。
IBM Research 在 Hugging Face 发布博客,聚焦开源模型、工具链与企业级 AI 应用协作,强调研究成果更快落地。该内容反映 IBM 通过 Hugging Face 扩大模型分发与社区影响力,适合关注大模型生态、MLOps 和开源 AI 的读者检索。
教程模型卡译 -
庆祝视觉搜索创新 25 周年
Google Images 迎来 25 周年,回顾了其从图片搜索到视觉内容创作的关键演进。如今,用户可通过更多新方式探索、生成和组织图像内容,进一步提升搜索体验与创作效率。
GoogleGemini译 -
我们还剩下什么可做?
ICML 2026 主题演讲聚焦大模型训练与推理的最新进展,强调更高效的扩展策略、低成本部署和更可靠的对齐方法,为下一代通用 AI 系统指明方向。
分析实践译 -
《Minecraft》缺少了一个绝妙的点子
视频论文译 -
模型爆发:GPT 5.6 Sol、Grok 4.5 与 Meta Muse 改写规则
视频模型评测译 -
DeepSeek 的惊人 AI 提速黑科技
视频论文译 -
Gemini API 中托管代理的扩展:后台任务、远程 MCP 等
Gemini API 新增 Managed Agents 能力,帮助开发者构建更可靠、可直接上线的智能体(agents);这是面向生产环境的代理开发能力升级,适合需要稳定执行任务、降低工程复杂度的 AI 应用。
GoogleGemini译 -
他们说这永远不可能实时运行
视频论文译 -
Fable 5 与 GPT 5.6 Sol:早期结果
视频模型评测译 -
开始使用 Nano Banana 2 Lite 和 Gemini Omni Flash 构建
Nano Banana 2 Lite 是谷歌最快三、最省成本的 Gemini 图像模型,适合快速扩展创意生成;同时,Gemini Omni Flash 支持高质量视频与对话式编辑,适用于需要低延迟、可交互多模态生产的场景。
DeepMind译 -
DeepSeek 刚刚解决了 AI 的十亿美元难题
视频论文译 -
Claude Fable 被拦截——关于下一步的 11 个低调细节
视频模型评测译 -
# 为什么 AI 还没有取代软件工程师,也不会取代
编码智能体(coding agents)正从“炫技”走向普通生产力工具:它们更适合被当作标准软件,而不是神秘的 AI。随着 GPT-4.1 等模型能力提升,团队更应关注可控性、集成和工作流,而非单纯追逐“更聪明”的代理。
分析实践译 -
Claude Fable 5——319页完整解析
视频模型评测译 -
什么才是完美的编码?你如何判断?
视频教程译 -
重塑熵:压缩即智能(第一部分)
视频教程译 -
新 Claude Opus 4.8:你可能错过的 15 件事
视频模型评测译 -
Google 的 AI 智能体真的用 916 美元构建了一个操作系统吗?
独立评估的重要性在于,它能为 AI 模型提供更客观的性能与安全性检验,避免仅依赖厂商自评带来的偏差。随着大模型规模扩大,第三方基准测试和审计已成为识别真实能力、偏见与风险的关键环节。
分析实践译 -
两项关于 AGI 的对立押注:Google I/O 亮点
视频模型评测译 -
GPT 5.5 登场,DeepSeek V4 发布,算力之战进一步升级
视频模型评测译 -
Claude Opus 4.7——性能与戏剧性的新前沿
视频模型评测译 -
Open-world evaluations for measuring frontier AI capabilities
CRUX 是一个用于评估 AI 在长周期、复杂且易出错任务上的新基准项目,聚焦模型在真实工作流中的持续推理、纠错与任务完成能力,帮助衡量其是否真正适用于实际生产场景。
分析实践译 -
Claude 神话:244 页发布文件中的重点摘要
视频模型评测译 -
新论文:迈向 AI 智能体可靠性科学
量化 AI 能力与可靠性差距:在基准测试中表现突出的模型,到了真实任务里仍可能因幻觉、工具调用失败和长上下文退化而失常。研究指出,GPT-4、Claude 3 等大模型的“分数很高”不等于“可稳定部署”,企业落地时必须同时评估成功率、错误率和可复现性。
分析实践译 -
AI 不会自动让法律服务变得更便宜
AI 正在法律服务中从“概念”变成“基础工具”:律所与法务团队开始将大模型用于合同审阅、检索判例、起草文书和流程自动化,重点不再是“能不能用”,而是如何像管理普通软件一样管理风险、成本与合规。
分析实践译 -
事实核查莫拉维克悖论
这句广为流传的格言其实既不正确,也不实用;与其把它当作普遍真理,不如直接把它视为一种误导性的简化说法。
分析实践译