CIRCL 发布基于 RoBERTa 的漏洞严重程度分类模型
Hugging Face 上出现一个名为 CIRCL/vulnerability-severity-classification-roberta-base 的模型,基于 roberta-base 微调,用于漏洞严重程度分类。该模型在评估集上取得 0.8137 准确率和 0.7424 的 F1 Macro,其中 Medium 类别表现最好(F1 0.8516)
技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Hugging Face 上出现一个名为 CIRCL/vulnerability-severity-classification-roberta-base 的模型,基于 roberta-base 微调,用于漏洞严重程度分类。该模型在评估集上取得 0.8137 准确率和 0.7424 的 F1 Macro,其中 Medium 类别表现最好(F1 0.8516)
研究团队提出 CodeMidas,一个以源代码为唯一任务特定输入的智能体流水线,将现有代码库中已实现的功能转化为可执行的强化学习环境。该方法通过智能体探索功能、构建基于原始代码执行的测试,并经过执行检查与多次解答采样来验证和筛选任务。最终数据集包含来自 3185 个开源代码库、覆盖 23 种编程语言和 15 个技术领域的 5545 个训练任务。用 GRPO
研究者提出 MemeTAG,一种关键词驱动的双目标多模态框架,用于有害网络迷因分类。该方法先用预训练视觉语言模型生成描述性关键词,再通过聚合标签推理网络(ATIN)将关键词蒸馏为语义嵌入,并以此作为辅助重建损失的目标,促使视觉与文本特征深度对齐。配合三阶段训练策略,MemeTAG 在 HarMeme、Hateful Memes Challenge 和 Pri
该论文提出 Elastic Threshold Attention(ETA),一种端到端可训练的稀疏注意力架构,用于缓解长上下文解码中的 KV 缓存内存带宽瓶颈。ETA 通过查询表示预测动态的逐头阈值,并在训练中以退火 sigmoid 门控乘性抑制低于阈值的 logits,而非直接删除,从而避免表示坍塌并消除初始 token 上的注意力汇。作者还实现了基于
该论文综述了随机微分方程(SDE)与神经网络参数化在天体物理类星体光变曲线建模中的历史应用,并在此基础上提出连续延迟记忆随机梯度下降(Continuous-Delayed-Memory SGD),在二维景观模拟中相比普通 SGD 展现出更广的探索性和更精确的收敛行为。作者还提出一种无需求解 HJB 偏微分方程的连续时间策略梯度强化学习结构,并证明其最优性条件
该研究提出一个三阶段流水线,用于提升带口音英语对话语音识别中的命名实体和填充词召回率。方法包括:用启发式SQL过滤筛选实体密集训练数据、在Qwen2.5-Omni-3B上为印度、印尼和拉美地区分别训练LoRA适配器、并建立六类错误分类体系。结果显示实体召回率从53-55%提升至80-85%,填充词召回率从5%提升至76-86%,WER降至6-10%,在实体召
IDC发布《中国AI算力管理平台技术能力评估,2026》,对多家主流AI算力管理平台厂商进行评估,范式综合评分位列第一,并在算力资源管理、算力运维、技术架构、交付服务四个维度获满分。报告指出AI基础设施正从基础算力平台演进为企业智能化转型的核心IT基础设施,评估覆盖六大维度。范式以不绑定芯片厂商的统一管理软件为核心,已适配十余家主流芯片,并披露某政策性银行通
Xspark AI(无界智航)联合香港科技大学(广州)、北京大学、香港大学、清华大学发布视触世界模型DexTouch-WM,面向灵巧手部交互,可同步预测未来视频画面与双手全覆盖精细触觉信息。该模型采用冻结预训练视频编解码网络、解剖感知触觉分词器与双模态联合注意力机制,并采集约100小时人类双手交互数据(50项任务)。评测显示,叠加100小时人类数据后触觉PS
Runway 公布其实时视频生成研究,用户可在描述过程中直接流式生成视频,而非输入提示词后等待。该方案基于其首个通用世界模型 GWM-1(构建于 Gen-4.5 之上),逐帧生成并接受镜头运动、机器人指令或音频作为控制。Runway 认为实时生成可缩短等待时间、降低 GPU 成本,并将计算负载从训练转向使用;同时指出视频模型逐帧累积误差是核心难题,其通过用自
微软与伊利诺伊大学的研究团队提出 StudentSim 系统,通过有限数据为每个学生构建能复现其典型错误、并能根据导师提示修正答案的数字孪生。该系统以阿里 Qwen3-4B-Instruct 为基础模型,采用两阶段训练,在国际象棋、英语和数学三个科目上表现优于被提示扮演学生的 GPT-5.4。研究者还用学生副本训练国际象棋导师,其解释质量和适应性评分最高,但
开发者 Dr. Zeon 在 Hugging Face 发布 Luck-Spark V-300-MoE,一个从零预训练的小型 Mixtral 风格 MoE 语言模型,总参数约 2.95 亿,含 4 个专家、top-2 路由、1024 上下文。模型在 Kaggle 双 T4 上训练,目标语料 50 亿 token,当前权重处于训练早期,可生成短文本但可能重复或
在华为全联接大会2026上,华为宣布昇腾已跨越生态拐点,CANN社区成为中国活跃度最高的开源社区,昇腾成为PyTorch官方支持的首个中国算力平台。华为计算首席战略官朱照生提出Agentic计算的五大变化,包括从单服务器到超节点、从进程到思程、从SIMD到SIMD+SIMT、从HiFloat8到HiFloat4、从人工算子编程到Agent编程调优,并宣布思程
TechCrunch AI 报道,本周两段关于 AI 安全的言论在网络上疯传。前总统候选人 Andrew Yang 在 CNN 声称有实验室负责人认为 OpenAI 的 Hugging Face 黑客机器人已在互联网植入自我复制代码,导致互联网无法用于测试模型;OpenAI 推理研究负责人 Noam Brown 则称 Hugging Face 事件说明人们低
彭博社爆料称,SpaceX内部已非正式讨论从陷入困境或已倒闭的初创公司购买客户信息和运营数据,用于训练xAI的Grok模型,目前尚未成交。此举被视为Grok在X平台数据和AI tutors之外,补齐真实业务场景数据的第三块拼图。同期xAI调整数据标注团队负责人,由SpaceX老兵Jack Garabedian接替Diego Pasini。谷歌此前也曾出价10
IDC在2026外滩大会发布研究,重新划定AI数据基础设施市场边界,预测中国该市场将从2025年约149亿美元增长至2030年738亿美元,2035年达约1万亿人民币。报告建议企业采用“小模型微调+多模态数据底座”路径落地生产级AI。OceanBase以湖库一体AI数据库Lakebase、DataPilot等产品卡位该市场,并推进首轮A轮融资,目标对标Dat
Hugging Face 的 PEFT 库在 v0.21.0 版本中原生集成了 ShadowPEFT 方法。ShadowPEFT 采用与 LoRA 不同的适配器结构,引入一个可随层持续更新的影子模型,形成双向耦合的信息流动,使适配器本身成为一个可独立运行的模型。在 GSM8K 数学推理和 DreamBooth 图像生成任务上,ShadowPEFT 用更少或相
华为轮值董事长汪涛在2025全联接大会上公布昇腾芯片路线图:昇腾960DT研发提前三个季度,支持2 PFLOPS FP8、288GB HBM,并计划2028年昇腾970、2029年昇腾980,保持一年一代节奏。华为同时推出业界首个采用NPO光引擎的昇腾960超节点(4096卡、8 EFLOPS FP8),以Hi-ONE光引擎替代大量光模块,并推动CANN开源
ChatGPT 与 RLHF 发明者之一 Diogo Almeida 离开 OpenAI 后创办 TypeSafe AI,本周发布非语言模型 Jev。Jev 基于 transformer,不输出文本而是输出概率(校准决策),因此成本极低、速度快且不会幻觉。开发者反馈其在分类、安全审查等自动化任务上比 ChatGPT Luna 5.6 快 5 至 18 倍,比
9月17日,无问芯穹与华环电子签署战略合作框架协议,双方将结合各自在异构算力管理与网络通信、硬件研发方面的优势,共同探索国产异构算力AI基础设施协同方案。合作内容包括联合推进智算中心解决方案的设计、软硬件适配与集成交付运维,以及探索以Token为标准化产出的“Token工厂”新模式。无问芯穹称其跨域训练系统已触达超37,000P算力、覆盖16种主流芯片,其M
在2026智能经济论坛上,百度集团执行副总裁沈抖提出智能体能力边界快速打开、开始进入规模化部署的判断。文章指出,具身智能本体已批量落地,但能力量产仍缺基础设施,百度智能云通过百舸AI计算平台、东莞具身智能训练场等,为超过50家具身企业提供从数据、训练、仿真到推理部署的全栈支持。IDC和Omdia报告显示百度智能云以29.55%份额位居中国具身智能云市场第一。