PydanticAI v2.33.0 修复 Anthropic SDK 兼容性问题
PydanticAI 发布 v2.33.0 版本,修复了因 Anthropic SDK 1.0.0 基于 httpx2 重构而导致的兼容性问题。此前版本允许安装 anthropic 1.0.0 但运行时失败,新版本要求并支持 anthropic =1.0.0,并改用 httpx2 客户端。用户若需保留旧版 pydantic-ai,应固定 anthropic<
公司与模型 · Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03
PydanticAI 发布 v2.33.0 版本,修复了因 Anthropic SDK 1.0.0 基于 httpx2 重构而导致的兼容性问题。此前版本允许安装 anthropic 1.0.0 但运行时失败,新版本要求并支持 anthropic =1.0.0,并改用 httpx2 客户端。用户若需保留旧版 pydantic-ai,应固定 anthropic<
堪萨斯大学等机构的研究者提出了SNAIL,一个混合命名实体识别框架,用于从生物医学文献中自动识别生物信息学软件和数据库名称。SNAIL结合词汇与语义建模,利用SciBERT等Transformer模型和token掩码策略,并通过引用提示和LLM辅助蒸馏构建训练语料。在多个基准和真实文献上,SNAIL显著优于bioNerDS2及ChatGPT、Gemini等通
THE DECODER 的 Frontier Radar 第四期指出,中国 AI 模型如 Kimi K3 和 GLM-5.3 已接近美国顶尖模型水平,西方实验室指责中国通过蒸馏和刷分追赶,但模型领先优势难以维持。西方在抽象测试、可靠性和前沿领域仍有优势,但整体领先已转向系统层面。文章还提到欧洲在 AI 竞赛中落后。
PydanticAI 发布了 v2.32.1 版本,主要包含三个 bug 修复:拒绝在 agent 运行中的同步回调里调用 run sync(),避免向 Anthropic 发送空签名的 thinking 块,以及允许任意可调用对象作为 FunctionModel 的 function 或 stream function。这些修复提升了框架的稳定性和兼容性。
华尔街投行杰富瑞实测八款全球主流AI Agent,结果显示阿里千问办公综合得分第一,超越Claude Cowork和Codex等工具。报告将Agent能力拆分为模型与Harness,千问办公的隐含Harness分居首,且API价格较低,具备成本优势。报告认为企业级Agent竞争核心在于工作流和生态协同,千问办公已初步打通钉钉。
另有 1 家信源报道
雷峰网早报汇总了多项AI行业动态:宇树科技科创板上市首日股价暴涨,创始人王兴兴表情平静;豆包大模型正式上车特斯拉;字节跳动Seed基模团队调整组织架构;智谱发布GLM-5.3 API并计划开源;OpenAI第二季度营收67亿美元,增速不及Anthropic。
OpenAI 宣布推出一项名为 Private Safety Processing 的新服务,旨在通过自动化系统监控滥用行为,同时不保留客户数据,以在隐私保护方面超越竞争对手 Anthropic。该服务扩展了现有的零数据保留政策,可跨多个会话分析潜在滥用,而无需人工审查。此举与 Anthropic 最近宣布的保留客户数据 30 天的政策形成鲜明对比,后者已引
另有 1 家信源报道
LlamaIndex 发布 v0.14.24 版本,包含多个核心修复和功能增强。核心库修复了 HotpotQA 评估器文件句柄、CodeSplitter 叶子节点保留、MMR 搜索阈值等问题,并新增了属性图提取器的 raise on error 选项。各集成模块也同步更新,如 Anthropic 和 Bedrock 新增对 Claude Sonnet 5 和
Mastra 发布 2026 年 8 月 19 日更新,为 Agents API 增加无需部署的持久执行功能,并新增 Cloudflare Sandbox 提供商。MCP 协议升级支持无状态 2026-07-28 修订版和多轮 elicitation。RAG 模块新增 GraphRAG 快照序列化,降低大型语料库启动成本。核心包 @mastra/core 1
非营利组织Guidelight发布首份评估报告,指出Anthropic、OpenAI、Google、xAI和Meta等AI实验室未能完全对其内部AI系统实施基本控制措施。评估基于公开资料,检查了日志记录、风险审查、紧急关闭等六项实践,其中Anthropic和OpenAI得分最高(C+),Meta最差(F)。报告显示各公司在检测异常行为方面表现较好,但在预防和
华尔街投行杰富瑞实测八款全球主流AI Agent,结果显示阿里千问办公综合得分第一,超越Claude Cowork和Codex。测试涵盖五项真实办公任务,千问办公在复杂任务、浏览器控制及多模态生成中表现突出,且隐含Harness分居首。报告指出,Agent竞争正转向企业级场景,成本与生态协同成为关键。
另有 1 家信源报道
Cloudflare 推出 WriteGuard 私有测试版,为 MCP 服务器提供细粒度安全控制,旨在让 AI 代理在访问可修改数据的工具时更安全。WriteGuard 作为共享策略、归因和审计层,拦截所有 MCP 请求,根据工具策略决定放行或阻止,并记录审计日志。它无需为代理创建独立账户,而是复用现有 OAuth 凭证,并将代理上下文附加到人类身份上。W
该研究首次系统测量了编码代理中语言服务器协议(LSP)语义检索与词法检索(如grep)的令牌效率,提出“令牌到成功”指标并设计五臂消融实验。初步实验表明,在符号定位任务中LSP通常消耗更多令牌,仅在引用完整性任务中提高精度而非节省令牌,且对最弱模型Haiku有节省效果。研究建议采用自适应路由策略,根据任务类型和模型能力选择检索工具。
PydanticAI 发布 v2.31.1 版本,主要包含两项 bug 修复:在 Bedrock 上拒绝 Claude Sonnet 5 和 Fable 5 的原生结构化输出,以及为拒绝 MINIMAL 思考级别的 Gemini 模型回退到 LOW 级别。这些修复旨在提升模型兼容性和稳定性。
Nvidia 正大力投资近乎开源的模型(如 Nemotron),通过发布训练数据和代码,鼓励更多公司构建自己的模型,从而扩大对其芯片的需求。文章指出,开源模型生态的未来取决于能否形成经济回报闭环,否则可能转向效率优先的细分市场。同时,训练复杂度的提升和开源社区对后训练的关注,可能改变传统训练流程的划分。
404 Media 的一项调查通过 AirTag 追踪发现,亚马逊在拉斯维加斯的一个仓库中批量购买纸质书籍,切掉书脊进行扫描,用于训练其 Nova 模型,书籍随后被销毁。类似地,Anthropic 的“Project Panama”项目也购买书籍并扫描,但法院裁定该行为属于合理使用。这种做法因销毁稀有书籍而引发争议。
另有 2 家信源报道
诺基亚计划关闭杭州研发中心并裁员1600人,因中国业务持续下滑。DeepSeek API峰谷定价方案生效,高峰时段价格翻倍。苹果与阿里合作深化,阿里参与训练面向中国市场的更强模型。Claude出现大规模服务故障,影响Claude.ai、Claude Code等服务。
Moonshot AI 推出了 PerceptionBench 基准测试,用于独立评估多模态模型的视觉感知能力,不涉及逻辑推理和外部知识。测试结果显示,包括 GPT-5.6 Sol、Kimi K3 和 Claude Fable 5 在内的所有领先模型均表现不佳,最高准确率仅为 59.7%。作者指出,许多所谓的推理错误实际上源于视觉感知缺陷。该基准测试基于真实
Z.ai 发布了 GLM-5.3 模型,目前仅在编程计划中提供,API 即将上线,两周后开放权重。该模型在多个基准测试中超越了 Moonshot AI 的 Kimi K3,部分指标甚至超过 Claude Fable 5 和 GPT-5.6-Sol,且参数量仅为 Kimi K3 的三分之一。Z.ai 表示 GLM-5.3 基于 GLM-5.2 的相同基础模型,
LangChain4j 发布了 1.19.0 和 1.19.0-beta29 版本,主要更新包括:MCP 客户端更新至 2026-07-28 规范,支持 Milvus V2 服务及混合搜索,新增工具操作补偿机制,以及 AnthropicBatchChatModel 支持 Anthropic Message Batches API。此外,还增加了 watson