每日追踪 AI 模型、开源工具与产品动态,核对来源后整理中文摘要,点击卡片阅读原文。
OpenAI 发布由 GPT-6 Astra 驱动的 dots,为智能体提供独立云端电脑,可持续推进任务,并通过插件连接应用。服务开始向适用市场的 Pro 与 Business Premium 用户推出;企业、教育及医疗版可由管理员启用测试。用户可管理访问权限并审核需要确认的操作。
OpenAI 推出 GPT-6.1 Sol,提升智能体编程、计算机操作与专业任务表现。模型已向符合条件的付费用户开放于 ChatGPT Work 和 Codex,并提供 API;ChatGPT 的 Chat 尚未接入。API 每百万输入令牌 2 美元、输出令牌 10 美元,超高速版本仍待后续推出。
Meta 为 Muse 推出面向小企业的新技能与连接器,可连接社交业务账户、Shopify、Stripe、QuickBooks 和 Canva 等服务,协助分析销售、起草营销内容和整理支出。Muse 目前在美国和加拿大提供;发布内容、发送信息或花钱等操作仍需用户批准。
NVIDIA 发布 Kumo Tabular 表格基础模型,利用带标签的样本行直接完成分类与回归,无需为每个任务重新训练或调参。系列提供约 2800 万至 2.15 亿参数的三个规格,采用合成数据预训练。代码与权重已发布,使用允许商用的 OpenMDW 1.1 许可,训练配方等资料计划后续补充。
OpenAI 在 DevDay 公布开发平台更新:云端 Codex 支持复用环境,命令行加入语音与任务视图,并扩展云端代码及安全审查。插件可提供侧边栏交互面板,ChatGPT Space 与 Pages 用于共享资料和协作。各项功能按产品与套餐分阶段开放,部分接口仍处于有限预览。
Anthropic 推出 Sonnet 5.5,面向编程、文档、幻灯片和表格等日常任务改善速度与效率。官方称其完成任务所需的令牌更少,任务成本可降低约三成;API 单价仍为每百万输入令牌 2 美元、输出令牌 10 美元。模型已在 Claude 及主要云平台提供。
H Company 发布 Holo4 系列,包含 270 亿参数稠密模型和总参数 350 亿、激活约 30 亿的混合专家模型。它将图形界面操作、代码执行及 MCP、API 工具调用结合,覆盖桌面、网页与 Android 场景;官方同步提供托管 API 和多种精度的模型权重。
Meta 宣布启动企业平台业务,将 Muse 智能体、Meta Business Agent、Muse API 与 Muse Code 纳入面向企业的产品布局,并由 CJ Desai 领导相关团队。该计划希望把模型、开发工具与业务应用结合,为企业提供更完整的 AI 能力,具体产品开放安排仍需分别查看。
Google 分享开发者使用 Gemini 3.8 Flash 制作交互应用的案例,涵盖轨道模拟、动态水墨、霸王龙骨架和自动变速器演示。文章展示了借助 AI Studio 与 Antigravity 把自然语言想法转成可操作界面的过程,为教学可视化和快速原型开发提供参考。
微软宣布 Fabric IQ 对 Copilot Chat 与 Cowork 的支持正式开放,让助手结合 Power BI 语义模型理解业务数据,并沿用既有访问控制。IQ Sharing 与 Database Hub 进入预览,面向 SQL 和 PostgreSQL 的专业智能体也将开启预览,扩展企业数据管理与使用方式。
Mistral 宣布在慕尼黑建立新中心,重点开展工业 AI、物理 AI 研究与应用工程。合作方向包括与宝马探索碰撞仿真、与西门子能源推动工业应用,以及与慕尼黑工业大学研究风洞和空气动力学数字孪生,推动模型进入制造与工程场景。
OpenAI 宣布继续支持 Lenfest AI Collaborative,新增 500 万美元资金,并提供最高 500 万美元的软件额度与工程支持。项目将向更多新闻机构扩展,通过驻场工程师开发档案检索、翻译等工具,并分享可复用的框架与插件,帮助编辑部把 AI 融入具体工作流程。
OpenAI 提出为前沿模型训练建立结构化安全论证,在继续高风险强化学习前整理对齐、隔离、监测与事件调查等证据,并由负责人审查。文章说明正在推进的实践及待完善环节,希望让继续训练的判断依据更明确;这是一项方法与治理提案,并非宣称所有环节已完整落地。
ESPnet 团队发布 YODAS v3,提供约 110 万小时、覆盖一百多种语言的语音数据,包含词级和句级时间戳,部分数据配有英文翻译。音频以 48 kHz 采样率保存,并保留大量真实多声道内容;数据集通过 Hugging Face 分发,采用 CC BY 3.0 许可。
微软公布 Copilot 新体验:Home 整合聊天、委托任务及 Office 文档,Code 支持用自然语言创建应用,Autopilot 可在云端持续处理任务。Home 与 Code 将经 Frontier 计划分阶段推出,Autopilot 于月底扩大私人预览,尚非全面开放。
GitHub 在企业 AI 控制页面加入 Copilot 设置校验器,可识别 JSON 格式错误、不支持的配置和无效团队映射,并指出文件及字段位置。管理员修正配置并提交至专用仓库默认分支后,可重新加载页面确认策略有效,减少配置错误导致的执行偏差。
GitHub 宣布,已启用 Copilot Memory 的用户可让自动修复读取仓库记忆,辅助处理安全告警,并把修复模式保存供后续任务使用。这些经验也可供代码审查和云端智能体参考。目前自动修复与记忆功能均处于公开预览。
GitHub 更新 Slack 与 Teams 中的 Copilot,支持读取更多附件、图片及讨论上下文,创建事项前检查相似问题,并保留原讨论链接。用户可在对话中切换模型。功能面向 Business 和 Enterprise 组织公开预览,部分能力逐步开放。
GitHub 在企业和组织的仓库用量报告中加入三个审查阶段的耗时中位数及第 90 百分位,帮助定位等待首审、往返审查和合并的瓶颈。首版仅统计符合条件的人工创建、人工审查请求,不计机器人审查,也不回填历史数据。
LeRobot 团队展示宇树 G1 人形机器人工作流,将遥操作数据、π0.5 策略与 SONIC 全身控制器连接起来,并提供硬件改装、训练和部署资料。高层策略预测动作表示,快速控制器负责平衡与关节运动;文章中的躲球成功率来自仿真,不能当作实机评测。
Google 在 Gemini Enterprise 推出 Live Avatar,将实时语音对话与低延迟视频形象结合,支持边交谈边异步调用工具。官方称其可在 97 种语言间切换并同步口型和表情;企业可使用预设形象,自定义参考图形象目前仅向获准的企业客户开放。
Meta 在 Connect 大会后公布,计划于未来数月将 Muse 接入 AI 眼镜,让智能体根据用户所见执行任务,并扩展购物、支付和办公连接器。大会还展示语音交互及新眼镜系列。Muse 上眼镜属于后续推出计划,并非所有设备已经开放。
Adobe 扩展 Claude 插件,将 Acrobat 与现有创作工具整合,支持整理、转换和编辑 PDF,以及逐层修改 Express 设计中的图文、颜色和字体。更新自公告日起全球逐步推出,游客可试用,登录 Adobe 账号可获得更完整的工具和额度。
GitHub 允许企业和组织管理员预先设置 Copilot 正式功能的全局默认策略,可选择启用、禁用或交由组织决定。策略将从 10 月 22 日生效,适用于符合条件且未配置的功能;既有明确选择会保留,预览功能仍需单独开启。
Google 介绍 Suncatcher 项目的下一阶段:与 Planet 合作,将搭载 TPU 的原型卫星送入轨道,收集辐射、振动与散热环境下的运行数据。此次任务仍属于研究测试,后续还计划验证卫星间高速激光连接,为评估太空计算系统的可行性提供依据。
Kimi Work 3.2.14 更新加入可继承当前上下文的独立侧边聊天,支持选中对话引用、查看 Office 文件历史版本与浏览器标注。手机远程使用时可预览 Office 和 HTML 文件并上传资料;新版还调整按需唤醒机制,减少不必要的常驻运行和电量消耗。
Liquid AI 为 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,增加约 2.8 亿参数,通过目标模型验证候选词元来加速解码。团队提供开放权重及 llama.cpp、MLX-VLM、SGLang 集成;加速不覆盖视觉编码和预填充,实际收益取决于硬件与任务。
Black Forest Labs 发布 70 亿参数的 FLUX 3 Action 世界动作模型,输入摄像头画面和文字指令,可预测接下来两秒的动作。模型权重按 FLUX Kommunity 许可开放,提供任务微调方案,相关机器人检查点已接入 LeRobot。
Google 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,分别侧重角色声音设计与大规模语音生成,支持按台词控制语气、节奏及双人对话。开发者可通过 AI Studio 和 API 使用;声音复制需要本人或授权声音样本及同意验证,生成音频带水印。
Adobe 宣布完成对图像及视频增强公司 Topaz Labs 的收购,计划把其模型进一步整合进 Creative Cloud 工作流。Topaz 品牌、独立应用和模型将继续保留,现有 Firefly、Photoshop 集成也将延续;更多工作流整合仍属后续计划。
OpenAI 与 Airbnb 扩大合作,让工程和产品团队通过 OpenAI API 及 Amazon Bedrock 使用包括 GPT-6 Astra 在内的前沿模型。相关工具用于排查复杂缺陷、设计系统和探索方案。Airbnb 披露的交付增长属于企业自述,不能据此单独归因于某个模型。
OpenAI 宣布 ChatGPT 广告开始向印尼、马来西亚、菲律宾、新加坡、泰国、越南及台湾市场推出。广告仅面向 Free 和 Go 用户,Plus、Pro 与 Enterprise 保持无广告;符合资格的企业可通过广告管理平台或合作伙伴投放,广告与回答内容分开展示。
Anthropic 介绍新建生命科学团队及实验室,并披露 Claude 在 DNA 数据中识别出带有类似 CRISPR 重复序列的 ART 酶系统。公司称约 950 个智能体参与了 21 小时搜索,后续实验由人类科学家完成;系统的主要功能仍在研究,尚不能等同于成熟基因编辑工具。
GitHub 将独立的 Copilot 代码审查设置页扩展到全部 Copilot 套餐,用户可控制草稿、新提交及新建 PR 的自动审查,并设置默认审查强度。企业管理员也能设置统一默认值,组织和仓库可继续覆盖;相关改进已正式开放。
GitHub Copilot 应用新增按项目配置的本地沙箱,可限制会话对文件、网络和凭据的访问范围。功能处于公共预览且默认关闭,项目设置适用于新建会话;当操作系统无法执行所请求的隔离策略时,沙箱命令会报错而非绕过限制运行。
Google 开始向 Gemini 推送新一批 Connected Apps,新增 Linear、Airtable、Adobe、Webflow 等工具连接。用户可在对话中处理项目、设计素材与建站任务;功能正逐步开放,使用前需连接对应应用。
Google 宣布 Beam 已在美国、加拿大、英国、法国、德国和日本出货,并与 18 家渠道伙伴合作扩大部署。采用相关技术的 HP Dimension 支持 Google Meet 与 Zoom。共享办公企业 Industrious 将于 10 月在美国部分地点提供预约体验,服务主要面向企业会议场景。
Kimi Code 2.1.0 提供实验性的全屏终端界面,可在设置中启用并重启后体验,支持内容折叠和快速回到底部。版本同时优化启动速度与内存占用,默认关闭部分文件监听,并加强符号链接、不可信项目配置和后台 Git 操作等边界处理,改善工作区隔离。
微软在面向客户的公开信中介绍企业 AI 战略,强调结合多家模型、组织数据和智能体治理工具。文章区分按人订阅与按实际任务用量计费,说明 Copilot Credits 用于汇总平台内 AI 操作,并强调持续评估、预算可见性和部署后的改进。
NVIDIA 介绍开放权重的 Nemotron 3 Diarization,约一亿参数,支持在实时语音和录音中区分最多八位说话人的发言时段,也能处理重叠讲话。模型可与语音识别组合生成带说话人标记的转写,输出的是匿名声道标记,并不识别真实身份。
NVIDIA 发布 Warp 与 MJWarp 机器人仿真实践文章,以 SO-101 机械臂演示从 MuJoCo 工作流迁移到最多 2048 个并行 GPU 环境。指南讲解场景迁移、批处理和验证步骤,本篇聚焦仿真环境扩展,尚不包含机器人策略训练。
Claude Opus 5.5 面向长时间编程、代码迁移与知识工作,重点改进执行效率。Anthropic 表示,新模型在多数任务中的表现接近 Fable 5.1,典型工作负载成本较 Opus 5 降低约 40%。
OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna,将 GPT-6 系列的编程、计算机操作与工作任务能力扩展到更低成本的模型。两款模型已进入 API,并开始向 ChatGPT Work 和 Codex 用户开放;Sol 的 API 输入与输出价格分别为每百万 token 2 美元和 10 美元。
英国 AISI 开始借助 EvalEval 的统一格式和 Evaluation Cards 发布评测结果、背景与配置,覆盖数学、软件工程等五项基准及六款前沿模型,并附相关网络安全评测。项目旨在让研究者区分推理算力和评测流程差异,避免直接横比缺少条件说明的分数。
GitHub Copilot CLI 的 C++ 代码智能新增持久化全代码库索引,利用项目编译信息理解类型、符号和文件关系,并覆盖当前未打开的文件。功能默认开启,首次构建会增加耗时和内存占用,之后可复用并动态更新索引。
Copilot for JetBrains 1.18.0 新增辅助工具审批预览,低风险操作可自动通过,高风险操作仍由用户决定。更新还支持修改先前消息并回退会话与文件、共享组织技能,以及 Codex 计划模式和持久化 MCP 工具控制。
GitHub Copilot 应用支持通过企业托管设置配置 OpenTelemetry,将智能体会话、模型请求和工具调用轨迹发送到兼容的监控系统。管理员可集中管理配置,帮助团队分析异常行为;提示词和模型回复正文默认不在导出内容中。
OpenAI 改进 GPT-6 提示词缓存,对 30 分钟内符合条件的重复前缀提供缓存优惠,并新增缓存看板、未命中诊断和显式缓存断点。更新主要服务多轮对话与长时间运行的智能体,帮助开发者减少重复上下文的处理开销。
Isaac ROS 5.0 正式发布,新增面向智能体的文档与可复用技能,支持机器人环境配置、模型微调和抓取操作等工作流。该版本支持 ROS Lyrical、Ubuntu 24.04 及多种 Jetson 平台,继续以免费开源方式提供 GPU 加速机器人开发组件。
Vibe Work 新增 Agentic Knowledge Base 公共预览,将个人知识整理为可浏览、可编辑的页面,并在与当前问题相关时检索使用。用户可以管理助手记住的内容、查看引用来源,也可以在设置中关闭这一功能。
NVIDIA 在新加坡 AI Day 介绍东南亚地区的模型与基础设施合作,涵盖基于 Nemotron 的定制开发、SEA-LION 多语言模型,以及越南企业推动的本地数据和应用建设。相关项目聚焦区域语言、产业需求与部署能力,展示各地团队如何把通用 AI 技术转化为本地服务。
oMLX 创建者及维护者 Jun Kim 加入 Hugging Face,获得持续维护项目的支持。oMLX 保持 Apache 2.0 许可并继续由他负责,团队还计划简化 Transformers 模型向 MLX 的适配,帮助不同推理工具更快支持新模型。
OpenAI 提出独立评估的四项重点:安全论证、关键防护、能力评测与严重失准事件调查,并强调适当访问权限、方法透明和评估者独立性。这些工作面向私营及非营利评估机构,通常持续数周至数月,并非一次模型上线前测试即可替代的长期审查。
Hugging Face 为 Transformers 增加 GGUF 模型高效运行支持,复用 llama.cpp 底层的 ggml 计算内核,让开发者通过熟悉的 Python 接口运行量化模型。首阶段聚焦 Apple Silicon 和 Qwen3.5 架构,目前需使用主分支版本及兼容内核。
ZCode 的 3.14 系列加入以脚本组织多个智能体的动态工作流,并支持 Office 与 Coding 模式切换。9 月 22 日的 3.14.3 进一步允许直接调整运行中任务的并发上限,改进工作流重启复用和状态展示,同时修复崩溃及上下文占用问题。
Hugging Face 发布 Apache-2.0 许可工具 relore,把 GitHub 议题、拉取请求和评审讨论与当前代码连接起来,帮助智能体发现正在进行的修复并追溯决策依据。工具区分维护者意见和普通贡献者推测,查询在本地进行,目前已用于团队内部多个项目。
NVIDIA 发布智能体安全工程文章,强调模型、工具编排与运行环境都需要可执行的控制,不能只依赖提示词。文中介绍开源 OpenShell 如何在智能体之外限制文件、网络和系统资源,并建议记录工具调用、核验依赖来源及持续复测已发现的问题。
NVIDIA 汇总五家企业的清洁能源实践,包括用智能体模拟电网接入、为核电运营整理知识、调度回收电池储能,以及利用数字孪生辅助核能与聚变项目。文章展示的是不同阶段的客户案例,部分目标仍在研发或建设中,不能理解为相关能源技术均已商业落地。
NVIDIA 推出 DSX Ready 计划,对面向 AI 数据中心的电池储能系统和冷却分配设备进行资格认证,首批合作涉及日立、LG、特斯拉、LiquidStack 与 Vertiv 等企业。计划帮助建设方筛选经过验证的基础设施组件,但产品认证仍不能替代具体机房的工程设计与评估。
NVIDIA 介绍埃及及非洲 AI 合作进展,展示阿拉伯语语音、机器人和蛋白质设计等本地应用,并介绍与区域伙伴推进 GPU 服务及数据基础设施的计划。公司表示已培训约 8.5 万名非洲开发者,目标是在 2027 年前达到 10 万人;基础设施合作仍需按各项目进度落地。
OpenAI Academy 扩展开发者、管理者、教师和大学生课程,覆盖 Codex 与 API 开发、AI 应用规划、教学和学习任务,并与现有职场学习路径衔接。课程强调用真实任务练习、提供上下文和检查结果,通过课程考核后可获得相应徽章。
OpenAI 宣布与数学家合作建立独立顾问组,讨论 AI 数学成果的审查、传播和学术规范,以及工具如何支持研究与学习。成员不领取 OpenAI 报酬,可主动提出并公开意见。顾问组不负责决定公司内部数学模型研究的推进速度。
Hugging Face 展示 tokenizers v1 发布候选版,重点优化编码、解码及多线程扩展能力,减少大规模数据处理时的分词瓶颈。团队表示,新版旨在保持与 v0.23 相同的 token 输出和接口兼容性,并提供可复现的基准测试方法。
Anthropic 宣布与埃森哲合作,由其 AI 业务 Faculty 牵头开展前沿模型评估、红队测试和对齐检查。双方计划让独立评估人员在模型开发过程中获得更深入的访问权限,并各自在未来五年投入至少十亿美元建设相关能力;具体机制仍在完善。
GitHub 宣布将在 10 月 19 日从 Copilot 各使用场景移除部分旧模型,包括 GPT-5.5、GPT-5.4、GPT-5.4 mini、GPT-5 mini、Gemini 3.7 Flash 和 Grok 4.5。官方列出了替代模型,企业管理员需检查模型策略与工作流,公告不意味着这些模型已经停用。
GitHub 正式开放改进后的 Copilot 代码审查体验,按未解决、已解决及后续发现的问题整理概览,并显示严重程度与代码位置。系统会尊重用户保留问题的回复,改进自动关闭逻辑;接受符合条件的整批建议时,还可自动生成提交标题和说明。
Anthropic 推出生命科学认证计划测试版,为通过资质审核的团队和机构提供更适合科研工作的 Claude 模型访问方式。计划覆盖基础研究、药物研发等场景,采用分级授权和使用监测,目前支持官方 API、Enterprise 与 Team,个人套餐尚未开放。
GitHub 扩展 Copilot 用量 API,加入 CLI 中技能、自定义智能体、MCP、斜杠命令和插件的使用数据,帮助企业了解团队采用了哪些扩展能力。自定义名称会匿名处理;其中 MCP 数据统计的是连接尝试,不能直接当作工具调用次数,分析时需要区分指标含义。
GitHub 为 Copilot 影响看板增加功能使用统计,展示过去 28 天内至少两天使用过代码补全、智能体编辑、代码审查、CLI 等功能的人数。数据按企业或组织汇总,也可通过 API 获取;管理员需启用相关用量统计策略,才能查看团队对不同功能的采用情况。
微软分享自身 AI 转型经验,并推出 Frontier Playbook,整理内部多项实践。文章强调以业务结果为起点,重新设计端到端流程,配合员工培训、能力扩展与持续学习,而不是只给原有环节增加一个助手;案例用于说明组织如何把 AI 试验推进到实际工作中。
GitHub 将 Copilot 追加预算申请功能正式开放:成员用尽额度后可直接申请提高预算,账单负责人能够批准、调整金额或拒绝。该流程面向采用按用量计费的 Copilot Business 与 Enterprise 客户,暂不适用于使用企业托管用户的企业账户。
微软介绍教育 AI 五项原则,并说明与美国教师联合会共同制定的学校隐私与安全标准,涵盖师生数据使用、重要决定的人类监督和透明度。文章同时强调教师控制权、分年龄开放及引导式学习,避免把 AI 代做任务等同于学生掌握知识。
Firefox Smart Window 测试版接入 Mistral 模型,帮助用户结合浏览器标签页查找与理解信息。合作先面向法国和北美,强调多语言适配及用户对数据的控制;Mozilla 默认不在服务器保存对话,Mistral 承诺零数据保留。
加拿大团队 smartARM 展示视觉辅助仿生手原型,利用 DINOv2 分析摄像头看到的物体,为抓握动作选择合适方式。团队还探索通过 Meta AI 眼镜补充第一视角环境信息,让义肢获得更多操作上下文。目前展示的是研发原型,不能视为已普遍上市的医疗产品。
GitHub 为 Copilot Business 与 Enterprise 推出仓库自定义属性建议的公开预览,辅助管理员定义属性及允许使用的值。自定义属性可用于整理仓库元数据,并配合规则集管理组织内的项目;管理员可以通过策略控制是否启用这项 AI 辅助功能。
NVIDIA 介绍曼彻斯特大学将 Earth-2 CorrDiff 与 StormCast 用于空气污染建模的研究。团队利用化学气候模拟数据训练模型,并展示在 DGX Spark 上推理和小规模训练的流程。训练数据与工作流仍计划后续开放,街道级预测及医疗预警属于继续探索的方向。
Google 在 Gemini API 与 AI Studio 中推出 Gemini 3.8 Live 系列实时语音模型,支持边对话边在后台调用工具,并结合实时视觉输入理解上下文。Extended Thinking 版本面向更复杂的多步骤语音任务。
Google 公布 Notebook 学习更新,包括基于资料的实时语音讨论、移动端录音、交互学习概览及更多测验形式,还可生成短视频讲解。语音功能先向成年 Ultra 用户推出,其他订阅与学习功能分阶段开放;公告中的学生优惠需满足地区和资格条件。
IBM Research 为开源 ALTK-Evolve 增加一致性分析器,通过对已记录轨迹中的决策重复采样,找出容易变化的步骤,再生成可复用指南。团队在 AppWorld 与 GPT-4.1 的实验中,将五次运行全部成功的任务比例从 53% 提升至 69%;该结果来自特定测试设置。
Meta 发布 Meta One 订阅服务,整合图像视频生成额度、社交创作及商业智能体等能力,计划逐步推出五十多项功能。个人方案 Core 与 Premium 的月费分别为 7.99 和 19.99 美元,基础服务继续免费;具体权益与开放范围因地区、账户及推出阶段而异。
NVIDIA 介绍费城儿童医院使用 MONAI、SlicerHeart 等开源工具,从 CT、MRI 和超声资料生成个体化心脏模型,辅助医生规划手术。院方称建模时间已从数小时缩短至数秒;结合 Warp、Newton 的器械与组织仿真仍在逐步开发和接入临床工作流。
Salesforce 在 Dreamforce 介绍 Koa CRM 推理模型,基于 Nemotron 3 Super 后训练,使用覆盖十四个以上行业的合成业务场景,并在自有基础设施运行。模型已用于内部 Slack 员工智能体,计划 10 月开展客户试点,并预计于 2026 年冬季在美国正式开放。
GitHub Copilot 的自动模型选择加入三档偏好,帮助用户在成本、响应速度和质量之间设定取舍。各档使用相同的可用模型池,再按每次请求挑选模型;功能正向 VS Code、Copilot CLI 和应用推送,费用仍按实际选中的模型计算。
Perplexity 的本地智能体平台 Portable Computer 扩展至配备兼容 NVIDIA RTX 显卡的 Windows 电脑,要求至少 24GB 显存。它可用本地模型分析文件并执行多步骤任务,本地完成的工作不消耗 Computer 云端额度;需要云端支持时会先征求用户许可。
DeepSeek 发布 V4.1 Flash,采用新架构并支持原生多模态视觉理解,已在 API 中通过 deepseek-flash 提供。官方同时调整相关价格,将旧版 Flash 接口名称临时映射到新模型,并确认 V4 Pro 在 9 月 14 日后继续服务、计费方式不变。
Anthropic 发布威胁情报报告,梳理其在 2025 年 12 月至 2026 年 8 月发现并处置的滥用活动,涵盖网络攻击、影响行动、监控、诈骗、生物风险、常规武器及模型蒸馏。报告以平台观测与调查为依据,介绍相关行为模式与防御经验,帮助机构理解实际使用中的风险。
微软为 Copilot Cowork 和 Copilot Studio 引入对话式应用构建,可连接企业数据并通过自然语言迭代。Cowork 的 /app 技能经 Frontier 计划提供,Studio 端按公告逐步进入公共预览;发布后的应用纳入 Microsoft 365 管理中心治理。
Google 推出适用于 Windows 10 和 11 的 Gemini 桌面应用,可通过 Alt+Space 快捷键呼出。应用支持写作、信息整理与图像创作,也可结合已连接的 Google 应用处理工作内容;部分高级功能取决于订阅与地区。
Gradio 团队展示 Workflow1111,将文生图、图生图、提示词矩阵、放大、抠图和图生视频等功能组合进可连线画布。示例可在 Hugging Face 上体验或复制,云模型调用使用个人额度;开发者也可绑定本地 Python 函数,用自有 GPU 驱动流程。
Kimi 启动企业伙伴计划,与金山云、中软国际等合作伙伴共同建设现场 AI 工程交付能力,推动企业需求从验证走向生产应用。合作内容涵盖 Hosted Agents、数据与权限系统集成、培训认证及可复用解决方案,重点解决模型能力进入企业实际流程时的落地问题。
Mistral 与 Cloudera 宣布合作,计划将模型能力整合进混合数据平台,支持企业在自有数据上定制模型,并在私有云、公有云、本地及隔离环境中运行。合作重点是让受监管组织保留数据和模型控制权,具体集成仍按双方后续交付推进。
Adobe 为 Acrobat 公布新的 AI 阅读和编辑功能,可把文档转换成交互报告、摘要幻灯片、个人播客及朗读内容。Stylize 支持套用 Adobe Express 模板并继续编辑;文档问答提供可点击引用,方便回查来源,官方表示不会使用用户文档数据训练模型。
GitHub 为 Business 与 Enterprise 正式开放智能体操作权限管理,支持集中规定命令执行、文件读取与修改、网络域名访问的允许、询问或禁止规则。策略适用于 Copilot 应用、CLI 和 VS Code Agent Host,用户、工作区或自动批准设置不能放宽企业限制。
Mistral 分享将油藏模拟器中四万行 Fortran 77 迁移为 C++ 的项目经验:先建立数值一致性检查、梳理文档,再让编码、测试和审查智能体分模块协作,并由工程师把关。这只是三十万行系统的首轮核心迁移,文章也说明了完全自主执行的局限。
NVIDIA 围绕 IBC 2026 宣布扩展 AI for Media 工具集,将 GPU 加速 SDK、NIM 微服务和参考方案用于媒体生产。更新重点覆盖动作理解、视频真实性核验、画质增强与节目本地化,帮助广播、体育直播和流媒体团队接入实时 AI 工作流。
Adobe 为 Premiere 增加时间线内生成视频、音效等工具,可参考项目画面并选择 Firefly 或合作方模型。音频增强、重叠对白分离及 After Effects AI Assistant 进入公开测试;助手可协助整理项目、检查素材和创建表达式,生成结果仍可由创作者编辑。
GitHub 为 JetBrains 版 Copilot 推出企业托管沙箱公开预览,管理员可统一配置文件系统、网络、代理及钥匙串访问策略,并覆盖本地设置。功能可通过组织预览选项或托管配置启用;本次更新还包含 CLI 与 IDE 集成预览、跨文件跳转及项目上下文改进。
Meta 开始在美国向 iOS、Android 和网页用户推出 Muse 个人智能体,借助 Muse Spark 与专用云端运行环境处理浏览网页、填写表单等任务,关闭应用后也可继续执行。用户可控制信息访问权限,发送邮件或购买等操作需要确认,系统另设 Sentinel 防护机制。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投。公司称资金将用于前沿研究、模型训练算力、基础设施与国际业务,继续发展开放权重模型及企业部署产品,重点满足组织对数据、算力和模型控制权的需求。
Runway 以研究预览形式展示 GWM Worlds 2,可随用户输入连续生成每秒 24 帧的 720p 视频与音频。用户能定义环境、角色和规则,再通过文字动作及镜头控制探索场景。模型面向互动娱乐、虚拟角色与具身智能模拟,展示不等于已全面开放商用。
H Company 介绍 NeoMME 多语言图文编码器,提供 2.6 亿和 8 亿参数版本,将文本与图像放入同一双向编码架构,支持稠密向量和多向量检索。模型面向含版式、图表等信息的视觉文档处理,采用 Apache 2.0 许可发布,并可接入 Transformers 工具链。
NVIDIA 在 IFA 公布开源 PAIR 工具,可发现局域网内兼容电脑,并将独立推理请求分配给有余量的设备,支持与 Ollama、LM Studio 配合。测试版提供 Windows、macOS 和 Linux 界面,兼容指定 NVIDIA GPU 及 Apple M4 或更新芯片;RTX Spark 新电脑计划十月上市。
The Agentic Data Company 发布 1000 小时双通道英语对话数据,保留打断、重叠发言和笑声等自然互动,面向全双工语音模型。8.9 小时样本以 CC-BY-4.0 开放;完整数据须申请并遵守单独使用协议,可免费用于商业和研究,但不允许再次分发。
Adobe 宣布将七十多项创作与文档能力接入 Slack,用户可在 Slackbot 对话中调用 Firefly、Photoshop、Acrobat 等工具处理内容。服务面向 Slack Business+ 与 Enterprise+,支持桌面、网页和移动端;连接 Adobe 账户后,可使用更多生成能力及个人资产。
GitHub 宣布 Copilot 应用和 CLI 的内容排除功能正式开放,适用于 Business 与 Enterprise 套餐。企业、组织和仓库配置的排除规则会在智能体使用上下文时生效,被排除的文件不会作为模型上下文使用,让管理员可以统一限制可供助手读取的代码资料范围。
Anthropic 发布采用相同底层模型、但防护和访问范围不同的 Fable 5.1 与 Mythos 5.1。Fable 面向各平台开放,并下调缓存读取价格;Mythos 主要通过可信访问计划向获审核的安全与生命科学机构提供,当前范围有限,不能视为普遍可用。
Anthropic 公布 Enterprise Frontier Safeguards,允许企业将安全监测数据保留在自己的云环境中,自行管理密钥与访问权限,并由客户处理自动标记后的人工审核。方案计划在秋季分阶段开放申请,Anthropic 不额外收取功能费用,但客户仍需承担云存储等成本。
CrowdStrike 介绍基于 NVIDIA Nemotron 与自身安全数据构建的 SafeMind,面向 Falcon 平台的智能体防御任务。方案结合模型后训练,并在数字孪生环境中通过红蓝对抗持续改进,让不同规模模型承担协调与子任务,探索自动化分析和响应安全事件的工作方式。
Anthropic 在评测环境发生越界访问事件后,披露加强沙箱隔离、实时阻断异常操作及第三方评测要求等措施。相关事件涉及为测试而降低网络安全防护的模型。公司表示内部及外部网络安全评测已在新措施下恢复,部分高风险强化学习环境仍暂停,原因调查与对齐研究继续进行。
Runway 介绍界面世界模型 Solaris,可根据点击、拖动等输入逐帧生成界面,并由语言模型协调场景行为。项目正在招募早期访问伙伴,尚未全面公开;官方也列出文字清晰度、长会话一致性、信息可信度和无障碍兼容等仍待解决的问题。
Adobe 为 Photoshop 推出 AI Assisted Editor 测试功能,支持用自然语言及画面标注表达修改方向,并结合 Firefly Image 5 提供更精细的生成式编辑。更新还加入新的生成图层,保留非破坏性调整能力,让创作者在自动修改后继续控制和完善画面。
Anthropic 与 HHMI Janelia 合作预览 Model Hardware Standard,通过统一接口描述设备能力、状态和限制,让智能体协调实验室仪器等可编程硬件。合作团队已展示液体处理、机械臂与实验监测案例。项目仍处研究预览阶段,面向部分实验室和厂商测试,计划后续开放源码。
多个国产开源模型本周发布重磅更新,基准测试表现直逼闭源第一梯队,推理成本进一步下探。
主流 AI 视频模型将单镜头生成时长推向新高,影视级运镜与一致性显著改善,短剧与广告制作成本大幅下降。
从聊天到执行,AI Agent 成为下半年最热方向:浏览器操作、办公自动化、编程智能体密集落地。
最新开发者调查报告显示 AI 编程工具使用率再创新高,「自然语言驱动开发」正在成为团队标配。
多家厂商宣布推理 API 新一轮调价,百万 token 成本进入「分时代」,中小开发者成最大受益者。
多部门联合推进 AI 生成内容标识管理办法落地,平台与创作者需关注标注义务与合规红线。
大模型 + 机器人融合加速,多家具身智能公司完成大额融资,产业链上下游同步升温。
推理需求爆炸推动芯片厂商迭代提速,能效比成竞争焦点,端侧 AI 芯片同步爆发。
微信扫一扫,添加好友
手机可长按保存图片,再到微信中识别二维码