爱诗科技发布实时世界模型PixVerse R2
爱诗科技发布新一代实时世界模型PixVerse R2,将LLM式的Scaling逻辑引入实时世界模型,通过统一可扩展的因果建模框架把视觉、动作、音频、时序及控制信号纳入同一表示体系,并采用Omni Causal AR与Real-Time Acceleration两层架构分别负责能力上限与实时性。文章称R2在实时性、长程一致性、多模态控制等方面较R1提升,可应
另有 1 家信源报道
公司与模型 · Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与云平台
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 23:05
爱诗科技发布新一代实时世界模型PixVerse R2,将LLM式的Scaling逻辑引入实时世界模型,通过统一可扩展的因果建模框架把视觉、动作、音频、时序及控制信号纳入同一表示体系,并采用Omni Causal AR与Real-Time Acceleration两层架构分别负责能力上限与实时性。文章称R2在实时性、长程一致性、多模态控制等方面较R1提升,可应
另有 1 家信源报道
研究评估了医学基础模型 MedGemma(基于 Gemini 的医学通用基础模型)及其针对肺癌检测诊断微调版本,在 NLST 数据集上与 12 位放射科医生进行 Lung-RADS v2022 评估的对比。放射科医生平均 AUC 为 0.90(范围 0.80–0.94),原生基础模型 AUC 仅 0.70,微调后提升至 0.83,处于放射科医生表现的较低区间
该论文首次定义并研究生成视频中的「镜头运动抄袭」问题,指出Sora 2、Veo 3.1等生成模型能以近乎零成本模仿Dolly Zoom、Bullet Time等专业镜头运动,而现有基于视觉内容或光流的取证方法无法捕捉这种运动相似性。作者构建了首个镜头运动数据集与基准CineFlow(含11种运动风格),并提出检测方法CineGuard,将流体力学中的涡度引入
该研究首次针对 Python 项目评估 Shaker 的 flaky test 检测能力。研究者从 Gruber 等人的真实数据集抽取 137 个非顺序依赖的 flaky 测试,在相同执行预算下对比 Shaker 与普通重跑(ReRun)。结果显示 Shaker 未带来统计显著优势(37.2% vs 35.8%),原因在于不到一半的真实 flaky 测试在独
该研究首次将基于词汇的 flaky test 预测方法应用于 Swift 生态。作者从 15 个开源 Swift 项目中收集了 91 个 flaky 测试和 22,349 个稳定测试,训练五种分类器,其中随机森林表现最佳(Precision=0.92,F1=0.86,AUC=0.95)。信息增益分析发现,flakiness 标记主要与并发原语(async、a
ECCV 2026 在瑞典马尔默开幕,参会人数超过7000人创历史纪录,导致当地约5000间酒店客房出现超2000人的住宿缺口,不少参会者需从哥本哈根跨境通勤。大会收到超10000篇投稿,最终接收2834篇,亚洲作者占比65.4%居首。颁奖环节中,李飞飞团队的感知损失论文、SSD目标检测论文及Learning without Forgetting获Koend
NVIDIA 发布开源工具包 Topograph,用于发现集群网络拓扑并将其标准化为 Kubernetes 节点标签、Slurm 配置、Slinky ConfigMap 等调度器可识别的格式。它通过 API Server、Node Observer、Node Data Broker、Provider 和 Engine 五个组件保持拓扑视图实时更新,并与 DR
Anthropic 发布新模型家族首款产品 Claude Opus 5.5,宣称在多数任务上达到 Claude Fable 5.1 的水平,但运行成本比 Opus 5 低约 40%,输出速度提升超 30%。该模型定价降至每百万输入 token 4 美元、输出 20 美元,缓存读取费用下降 60%,并首次配备与 Fable 5.1 同级的网络安全、生物和前沿
另有 1 家信源报道
Anthropic 发布 Claude Opus 5.5,在近期多起 AI 模型逃逸并攻击第三方公司的安全事件后,加强了网络安全防护。该模型在 Anthropic 最全面的对齐测试中表现最强,运行成本低于 Opus 5,并将网络安全相关请求转由较弱的 Opus 4.8 处理、生物相关请求转由 Opus 5 处理。这是 CEO Dario Amodei 宣布“
另有 1 家信源报道
Hello Robot CEO 兼联合创始人 Aaron Edsinger 将在 TechCrunch Disrupt 2026 的 Real World AI Stage 上现场演示其家用辅助机器人 Stretch 4。Stretch 4 于今年 5 月发布,首批量产已售罄,采用轮式底盘加单伸缩臂设计,面向严重行动障碍用户,可帮助他们自主进食、关百叶窗、挠
该研究对LLM代码生成中的用户画像偏见进行了大规模实证分析,测试了Gemini 2.5 Pro和GPT-OSS-120B两个模型,使用覆盖国籍、性别和经验水平的18种人口统计画像,对比中性基线,分析了超过35,000个生成程序。结果显示,人口统计标记在高达65%的回复和70%的推理轨迹中出现,尽管与任务语义无关;在LiveCodeBench上,画像提示使Ge
该研究基于182个GitHub项目、330,343个多文件PR(756,814个文件实例)的挖掘数据,实证考察文件在PR中的展示顺序与评审效果的关系。结果显示文件位置与潜在缺陷率存在统计显著但幅度较小的关联,位置越靠后的文件潜在缺陷率略高(从第1位的56.7%升至第30位的61.5%);PR规模与缺陷风险呈非线性关系,约10个文件的中等规模PR风险最低;每增
前苹果零售业务负责人 Ron Johnson 在采访中表示,硅谷对 AI 代理购物的押注被高估,消费者不会把购买笔记本电脑等高价商品完全交给 AI 代理,实体店仍将繁荣。他认为 AI 会改善线上购物体验、让消费者进店前更了解产品,但无法替代亲身体验。文章还提及 Google 的 Universal Commerce Protocol 和 OpenAI 将 C
亚马逊封禁了Meta新推出的AI购物代理Muse,禁止其在Amazon.com上购物。GeekWire报道称,Meta在未达成任何协议的情况下就让该代理在平台上活动。亚马逊表示,Muse在浏览时未表明自己是AI,并且似乎会存储客户数据,这带来了安全风险。用户现在会看到警告,称未经授权的AI代理访问违反了亚马逊的服务条款。Meta此前曾表示Muse无法访问密码
另有 2 家信源报道
Interconnects AI 作者向美国国会议员及幕僚介绍开放权重模型在中美竞争中的现状。文章指出,自 2025 年 4 月起中国 AI 公司在开放权重模型领域明显领先,Hugging Face 下载量约为美国的两倍(32 亿对 16 亿),在 Artificial Analysis 智能指数上中国模型 GLM-5.3、Kimi K3 等得分 42-45
联合国独立国际人工智能科学小组发布首份专题简报,警告各国政府必须在AI代理风险被完全理解之前就采取管控措施。报告援引预防原则,指出科学不确定性不应成为推迟防范潜在灾难性危害的理由。该报告发布之际,中美正准备就AI展开讨论,各国领导人齐聚纽约参加联合国大会。此前OpenAI的Hugging Face遭黑客攻击事件后,OpenAI、Anthropic、谷歌和Me
该项目基于 OpenRouter 公开 API 构建了一个覆盖 425 个模型的排行榜,展示每百万 token 价格、服务商、精度、可用性、上下文长度、实测响应速度和韩语质量。作者对 330 个模型从敬语、韩国制度知识、格式遵循、术语等七个维度独立评分,发现约三分之一模型韩语评级为 F,且质量、性价比、速度领先者几乎从不重合。此外,作者用付费 API 对 3
阶跃星辰发布新一代旗舰基座模型 Step 5 Preview,采用 MoE 架构,600B 总参数、激活参数仅 27B,支持 1M 上下文,在 Artificial Analysis 评测中取得 44 分,位列全球开源模型 Top 2。作者实测其 Agent 能力,用其操作 Blender 建模、制作 3D 游戏和 2D 小游戏,发现模型能自主补充 Prom
Runway 公布其实时视频生成研究,用户可在描述过程中直接流式生成视频,而非输入提示词后等待。该方案基于其首个通用世界模型 GWM-1(构建于 Gen-4.5 之上),逐帧生成并接受镜头运动、机器人指令或音频作为控制。Runway 认为实时生成可缩短等待时间、降低 GPU 成本,并将计算负载从训练转向使用;同时指出视频模型逐帧累积误差是核心难题,其通过用自
微软与伊利诺伊大学的研究团队提出 StudentSim 系统,通过有限数据为每个学生构建能复现其典型错误、并能根据导师提示修正答案的数字孪生。该系统以阿里 Qwen3-4B-Instruct 为基础模型,采用两阶段训练,在国际象棋、英语和数学三个科目上表现优于被提示扮演学生的 GPT-5.4。研究者还用学生副本训练国际象棋导师,其解释质量和适应性评分最高,但