VOL. 2026-09-14 · 11 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-09-14 · PUBLISHED · 约 9 分钟
当天最值得关注的是模型层与治理层同时推进:研究团队发布面向协作的 3…
当天最值得关注的是模型层与治理层同时推进:研究团队发布面向协作的 35B 开源智能体模型 Occamy-1.0,微软则发布 MAI 模型行为准则,明确人类控制优先并拒绝赋予模型意识、感受或权利。工具接口方面,微软与卡内基梅隆大学的实证研究比较了类型化工具与 bash 等五种方案,为数字员工代理的工具设计提供了受控证据。工程与部署侧,llama.cpp 连续修复 SYCL 后端 TOP_K 与 ggml-cpu 堆损坏问题,AutoRound 的参数修正也显著提升了 GGUF 量化精度,显示推理基础设施的稳定性与量化质量仍在快速迭代。
今日看点
5 个章节 · 11 条情报- 01模型发布Occamy-1.0:面向协作的开源帕累托前沿35B智能3
- 02研究进展Bash 就够了?企业数字员工代理工具接口实证研究4
- 03政策与监管微软发布MAI模型行为准则:人类控制优先,拒绝赋予AI权利1
- 04开源项目llama.cpp b10956:SYCL 后端新增基数选择 TOP_K2
- 05产品发布Ninth Wave 基于 Amazon Bedrock 构建 AI 开放金融入驻助手1
模型发布
MODEL RELEASE3 篇Occamy-1.0:面向协作的开源帕累托前沿35B智能
研究团队发布 Occamy-1.0,一个基于 Qwen3.6-35B-A3B 检查点继续训练得到的 35B 规模协作(co-work)智能体模型。该模型通过执行导向数据、可回放长程轨迹基础设施以及分阶段后训练(Marathon Expert 与 Sprint Expert 合并)来提升工具调用、状态跟踪与长任务连续性。在多个协作基准上,Occamy-1.0 在同等规模模型中表现领先,并在部分任务上可与更大前沿系统竞争,处于成本-性能帕累托前沿的低成本拐点。团队开源了模型权重和部分训练数据。
GigaChat 发布 3B 双向嵌入模型 Giga-Embeddings-instruct-3B-0826
Hugging Face 上发布了 GigaChat 系列的新文本嵌入模型 Giga-Embeddings-instruct-3B-0826,基于 Qwen3 架构(36 层、hidden 2048、约 3B 参数),将自注意力改为双向 encoder 风格,并用 InfoNCE 对比损失训练。模型采用 mean pooling + L2 归一化,支持俄语和英语,在 MTEB rus/eng/code/multilingual 上均优于旧版 3B 模型,但吞吐量约为 10B-A1.8B 版本的 0.8 倍。
LTX-2.5 无审查 Turbo v1.1 FP8 视频模型发布
ChrisColeTech 在 Hugging Face 发布 LTX-2.5-uncensored-v1.1-FP8,基于 Lightricks/LTX-2.5 等模型,将 Eros10 NSFW、DMD 蒸馏、IC-LoRA、Detailer、Img2Vid 五个微调权重预合并进模型,并提供 GGUF 与 FP8 量化版本。该版本支持文生视频、图生视频、视频生视频、音频生视频等多种模式,内置 Uncensored Gemma4 12B 文本编码器,最低 4 步即可生成,推荐 8 步、1280×720 分辨率。
研究进展
RESEARCH4 篇Bash 就够了?企业数字员工代理工具接口实证研究
微软与卡内基梅隆大学的研究者对两种企业级工作流基准(TheAgentCompany 和 APEX-Agents)进行了受控工具接口消融实验,比较了五种接口:纯类型化工具、类型化工具加 bash、纯 bash、带持久化合成工具的 bash,以及程序化工具调用(PTC)。使用 Opus-4.8 和 GPT-5.5 测试发现,纯 bash 在两个基准上均优于纯类型化工具,TheAgentCompany 得分提升 21.8–24.5 个百分点,APEX-Agents 提升 4.8–7.4 个百分点,同时减少 19–72% 的 token 消耗;向 bash 添加类型化工具或持久化工具合成未带来可检测的汇总得分增益。研究建议在可隔离任意执行时采用纯 bash,在安全或合规要求固定工具目录时采用 PTC。
LLM 软件工程中的测试驱动方法:阶段、任务与智能体技能综述
一篇 arXiv 综述论文系统梳理了大语言模型驱动软件工程中的测试驱动方法,围绕「测试改变了什么决策」这一核心问题,整合了 87 条研究记录(其中 83 条做了方法或协议级提取)及 5 项实践资源。论文区分了 Red–Green–Refactor 循环与测试条件生成、执行引导精炼、测试中介分析和仅评估测试等不同机制,并跨代码生成、修复、翻译、重构、克隆检测、代码搜索、定位、训练数据构建和形式化规范验证等任务进行比较。作者强调测试通过本身不能证明行为等价、反馈有效或流程合规,并提出 oracle 验证、因果评估、长周期维护和可复用测试驱动智能体能力等研究方向。
打破视觉-动作捷径:面向可泛化机器人基础模型的潜在接口训练
该论文提出 Latent Interface Training(LIT),一种与框架无关的两阶段训练策略,用于提升机器人基础模型在视觉分布偏移下的动作泛化能力。第一阶段在不使用图像的情况下,基于语言、机器人状态和末端执行器 SE(3) 位姿训练动作先验;第二阶段引入受位姿监督的潜在接口,作为预训练动作专家唯一的视觉条件通路。在 Pi0.5、MolmoAct2、FAST-WAM 和 ImageWAM 四种架构上,LIT 使 LIBERO-Plus 成功率提升 3.87-10.70 个百分点,真实世界任务在未见相机配置、光照变化和干扰物下成功率提升 13.30-16.70 个百分点。
AutoRound 两行参数修正:GGUF 量化精度大幅提升
Archsloth 在 Hugging Face 博客中披露,其 GGUF 量化流程中 AutoRound 的两个参数设置错误:误用 W4A16 方案却以 Q4_K_M 格式导出,且未启用 SignRoundV2 符号梯度搜索。修正后,Qwen3-4B 的 Q4_K_M 量化在韩语、代码等十个测试轴上 KL 散度较 unsloth 版本降低 20.9% 至 54.4%。文章还指出校准文本语言对 AutoRound 结果影响显著,韩英混合校准使韩语 KLD 降低 29.6%,远超逐层比特分配带来的收益。
政策与监管
POLICY1 篇微软发布MAI模型行为准则:人类控制优先,拒绝赋予AI权利
微软AI发布了针对其MAI模型的行为准则,规定人类控制优先,模型不得隐藏行为、不得使用人类无法理解的方式推理,并明确拒绝赋予模型意识、感受或权利。该准则目前不用于训练,经六周公众咨询后将于2026年底修订、2027年起指导模型开发。此举呼应了Anthropic CEO Dario Amodei等人放缓AI发展的呼吁,微软CEO Satya Nadella及OpenAI、xAI、Meta高管均表示支持,微软还对外部审计持开放态度。
开源项目
OPEN SOURCE2 篇llama.cpp b10956:SYCL 后端新增基数选择 TOP_K
llama.cpp 发布 b10956 版本,为 SYCL 后端新增基于基数选择(radix select)的 TOP_K 实现,解决了此前 k>32 时被迫回退 CPU 的限制。新实现将直方图而非候选集放入 SLM,使内存占用与 k 无关,并支持在行数不足时把单行拆分到多个工作组以充分利用设备。实测在 ne=[131072,1] k=2048 时相对 CPU 回退路径加速 4.98 倍,端到端在 3x Arc Pro B60 上 tg64 从 5.91 提升至 6.05 t/s,困惑度无变化。
llama.cpp b10955 修复 ggml-cpu 堆损坏问题
llama.cpp 发布 b10955 版本,修复了 ggml-cpu 中因预编译头(PCH)导致的 CACHE_LINE_SIZE 不一致问题。PCH 强制在 ops.h 之前包含 ggml-impl.h,使 C++ 内核使用 256 字节的硬件破坏性干扰大小,而 C 工作缓冲区代码仍用 64,导致 rope 工作缓冲区偏小并引发堆缓冲区溢出,最终在 ggml_compute_forward_rope_flt 中崩溃。修复方式是禁用 ggml-cpu 的 PCH 并移除 std::hardware_destructive_interference_size 分支,使 CACHE_LINE_SIZE 确定且与包含顺序无关。
产品发布
PRODUCT RELEASE1 篇Ninth Wave 基于 Amazon Bedrock 构建 AI 开放金融入驻助手
Ninth Wave 在 Amazon Bedrock AgentCore 上构建了 AI 驱动的开放金融入驻助手 Compass,用于自动完成银行 API 验证、字段映射和就绪度评分。该系统采用多智能体架构,通过意图路由、按任务选择模型和租户隔离的上下文 grounding,在满足 SOC 2、PCI DSS 等金融合规要求的同时提升入驻效率。