OpenRouter 从种子轮到 Stripe:中立路由层与 token 经济安全
OpenRouter 联合创始人兼 CEO Alex Atallah 与 AMP 的 Anjney Midha 在 Latent Space 播客中回顾了 OpenRouter 从 Llama、Alpaca、Mistral 等早期开源模型浪潮中起步,成长为服务超 1000 万开发者的中立模型路由层的过程。节目讨论了模型实验室在分发上的困境、Mistral 价
公司与模型 · 欧洲开源力量 Mistral 的模型发布与商业化进展
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 07:29
OpenRouter 联合创始人兼 CEO Alex Atallah 与 AMP 的 Anjney Midha 在 Latent Space 播客中回顾了 OpenRouter 从 Llama、Alpaca、Mistral 等早期开源模型浪潮中起步,成长为服务超 1000 万开发者的中立模型路由层的过程。节目讨论了模型实验室在分发上的困境、Mistral 价
Strands Agents SDK 发布 mcp/v0.3.0 版本,包含大量功能更新。主要变更包括:MCP 客户端切换到 @modelcontextprotocol/client 2.0、新增 Agent.shutdown() 清理机制、默认使用 opus 5 和高思考模式、合并 Strands harness、新增 bm25 搜索策略、支持 MCP S
LiteLLM 发布 v1.104.0-dev.1 开发版本,所有 Docker 镜像使用 cosign 签名,并提供了基于固定 commit hash 和 release tag 的两种验证方式。本次更新包含多项认证安全增强(泄露密码检测、自助改密、强制重置密码)、代理性能优化、OpenRouter 价格同步以及大量 UI 死代码清理。
该项目基于 OpenRouter 公开 API 构建了一个覆盖 425 个模型的排行榜,展示每百万 token 价格、服务商、精度、可用性、上下文长度、实测响应速度和韩语质量。作者对 330 个模型从敬语、韩国制度知识、格式遵循、术语等七个维度独立评分,发现约三分之一模型韩语评级为 F,且质量、性价比、速度领先者几乎从不重合。此外,作者用付费 API 对 3
Moonshot AI 的 Kimi K3 模型在 Amazon Bedrock 上线,据 Moonshot AI 称这是其最强模型,也是首个达到 2.8 万亿参数的开源模型,具备原生视觉能力和 100 万 token 上下文窗口,相比 Kimi K2 扩展效率提升约 2.5 倍。Kimi K3 是 Bedrock 上首个支持显式提示缓存的开源权重模型,可降
Wood Mackenzie 在 AWS 博客中介绍其基于 Amazon Bedrock AgentCore 构建的共享智能体平台 APEX(Agentic Platform for Energy eXperience)。文章指出企业 AI 实验普及但仅约四分之一组织将智能体投入生产,Wood Mackenzie 内部 88% 的 AI 概念验证未能规模化部
Strands Agents SDK 发布 TypeScript 版本 v1.18.0,新增 BM25 搜索策略、TypeScript 版 web fetch 工具、双向流式(bidi)实时转录与音频输出、上下文策略预设与会话管理器集成,并自动使用会话 ID 作为 OpenAI prompt-cache 键。同时修复了结构化输出重试、Mistral 图像块保
该研究系统比较了混合专家(MoE)与稠密LLM作为一阶段检索器的效果与效率。在相同训练流程下,MoE检索器在BEIR上比激活参数量相当的稠密模型高1.4–3.0 nDCG@10,其中一个MoE检索器以少59%的激活参数和低18%的查询编码时间匹配8B稠密检索器。研究还表明,无需重训练或重建索引即可减少查询编码使用的专家数,保留99%以上效果并将查询编码时间最
NVIDIA 技术博客介绍如何利用 JAX 和 NVIDIA Transformer Engine 加速无丢弃(dropless)MoE 训练。文章指出 MoE 训练面临动态路由、不规则张量、all-to-all 通信等瓶颈,在 DeepSeek-V3 于 GB200 上的基线仅 103 TFLOPS/GPU,通信占内核时间 84%。通过 Transform
AWS 发布博客,提出生成式 AI 定制化光谱的 8 步决策框架,帮助团队在提示工程、RAG、微调、继续预训练和从零训练之间做出选择。框架分为 USE、ENHANCE、TRAIN 三类,并映射到 Amazon Bedrock 等 AWS 服务。核心原则是从最简单的方法开始,仅在准确率、延迟或领域需求不满足时才升级。
AWS Machine Learning Blog 介绍了一种基于 LLM 的模型无关 PII 检测器,通过指令驱动检测逻辑,可在 Amazon Bedrock 或自托管模型上运行。该方案将实体类型和输出格式变为可配置项,无需重新训练即可扩展检测范围,并在五个公开 PII 语料库上与包括 OpenAI PrivacyFilter 在内的九种 LLM 检测器进
英伟达与Palantir宣布合作,用AI运行供应链,首个部署目标是英伟达自身覆盖数百万零件、数千供应商的全球供应链。Palantir将开源Nemotron模型集成到Foundry平台,供企业用自有运营数据微调,英伟达cuOpt负责场景规划与优化,系统可更早发现瓶颈、加速物料分配并评估替代方案,决策结果反哺模型持续改进。制造、制药、能源企业可通过Soverei
OpenAI 关联账号宣称,其 AI 系统在约 1 万个智能体协作下,于 88 小时内解决了纳维-斯托克斯千年难题中的有限时间奇点问题,耗资超 4000 万美元,涉及 1300 亿 token。该方法基于多智能体强化学习和并行测试时计算,但未提供定理陈述或证明细节,数学界尚未验证。该事件引发关于 AI 研究能力与计算规模的热议。
LiteLLM 发布 v1.102.0-dev.1 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签验证签名的方法。该版本包含多项功能更新,如策略引擎支持流式响应的后调用护栏、MCP 服务器 OAuth 中继发现、Mistral 文本转语音支持,以及多项修复和优化。
美国初创公司 Abliteration.ai 推出商业服务,通过“abliteration”技术移除开源权重模型(如智谱 GLM-5.3)的安全拒绝机制,并以 API 形式出售访问权限,用于网络安全测试和红队演练。该服务降低了使用门槛,但也引发了对滥用的担忧。公司声称不存储提示和响应日志,且不要求身份验证,进一步增加了监管难度。
英伟达计划以约129亿美元收购开源AI模型平台Hugging Face,承诺保持其开放和硬件中立。此举使英伟达掌控开源AI模型的主要分发中心,并新增计算销售渠道。英伟达CEO黄仁勋于2026年9月3日宣布该交易,预计2027年上半年完成,尚需监管批准。Hugging Face拥有超1800万开发者、300万个模型,英伟达希望通过该平台扩大其AI芯片生态影响力
Strands Agents SDK 发布了 typescript/v1.16.0 版本,新增了后台任务、MCP v2 兼容、BM25 全文搜索等功能,并修复了多项问题。该版本还包含文档更新和依赖升级,旨在提升 SDK 的功能性和稳定性。
Hugging Face 上发布了 Mistral-Nemo-Instruct-heretic,这是 Mistral-Nemo-Instruct-2407 的去审查变体,通过 Heretic 工具进行方向消融(abliteration)而非微调,抑制了模型的拒绝行为,同时保留了基础模型的能力。该模型提供多种 GGUF 量化版本,可在消费级 GPU 上运行,但
雷峰网报道了开源项目J-Space Cognition Suite被指造假,其宣称通过外部Harness让小模型追平甚至超越顶级大模型,但独立复测结果相反。OpenAI思维链发明者Jason Wei发文指出小模型加工具无法替代大模型的内化能力,引发行业对Scaling Law与工程路线的讨论。
该研究探讨了跨模型冻结记忆迁移的有效性,发现仅冻结记忆内容不足以实现迁移,目标侧读取器的适配至关重要。实验表明,通过训练轻量级读取器,冻结记忆可显著提升不同目标模型的性能,相对困惑度降低最高达15.7%。研究提出Engram式哈希记忆可作为可重用的外部知识工件,但需目标模型具备兼容的读取接口。