腾讯KDD Cup大赛600万奖金揭晓,冠军方案用DeepSeek网页版完成
腾讯营销在KDD 2026上举办了TAAC×KDD Cup大赛,聚焦推荐系统统一序列建模与特征交互,奖金池超600万元。冠军队伍lozyyeah提出CRAFT特征传输机制,工业赛道冠军日之光面方案实现AUC提升0.0048且算力消耗降18%。大赛吸引全球13913名选手参与,腾讯借此布局全球人才挖掘与培养。
公司与模型 · DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与能力的搅局者
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03
腾讯营销在KDD 2026上举办了TAAC×KDD Cup大赛,聚焦推荐系统统一序列建模与特征交互,奖金池超600万元。冠军队伍lozyyeah提出CRAFT特征传输机制,工业赛道冠军日之光面方案实现AUC提升0.0048且算力消耗降18%。大赛吸引全球13913名选手参与,腾讯借此布局全球人才挖掘与培养。
StateM 是一个通过持久状态、可恢复运行手册和程序化控制来提升长时程智能体执行能力的运行时系统,无需修改模型权重。在 Terminal-Bench 2.1 上,StateM 将 GPT-5.5 xhigh 的准确率从 83.1% 提升至 92.1%,并将 GPT-5.6 Sol xhigh 提升至 95.3%,同时将 DeepSeek-V4 Flash
金山办公旗下AI办公智能体灵犀专业版首批接入DeepSeek-V4-Pro正式版,用户可直接使用。该模型支持100万token上下文,Agent任务能力增强。灵犀专业版结合模型能力与办公工具,提升复杂办公任务的交付能力。
该论文提出一种在笔记本电脑上模拟大规模LLM智能体社会的方法,通过用低参数代理模型替代每个LLM智能体,这些代理模型从数百到数千次廉价查询中拟合而来。研究引入了一个交互顺序×记忆的分类法,用于预测替代误差的N趋势,并在EconAgent等八个LLM模拟中验证了该方法的有效性。
另有 1 家信源报道
EvoX Genesis 提出了一种以持久化软件项目为核心、而非持久化代理的软件工程组织方式,使本地代理保持有限生命周期。该系统利用 DeepSeek V4 Flash 在 120 小时内构建了约 25 万行代码的 Rust 编译器,成本仅 44 美元,并通过了完整测试套件;同时用 GLM 5.2 实现了 MESA 模块的 Rust 重写,获得 1.55-6
微软发布了用于 GitHub Copilot 的代码模型 MAI Code 1.1 Flash,声称性能提升、成本降低,但基准测试显示其在价格和性能上均不及 DeepSeek-V4-Flash-0731。微软在公告中回避直接对比,并继续推广其专有模型,与其宣称的开源 AI 立场不符。此举可能是为了降低成本,但可能导致性能下降。
本研究通过进化迭代囚徒困境实验,比较了四款中国前沿大模型(DeepSeek V4 Pro、Qwen3-Max、Kimi K2.5、GLM-5.1)的合作倾向。研究发现,这些模型并非铁板一块,实验室间差异显著,且中国模型内部的差异大于中国与西方生态系统之间的平均差异。研究还发现,中国模型的合作倾向普遍性较弱,但这一结论受转换器选择影响。
NVIDIA 在八月庆祝本地 AI 生态,发布多款新模型和工具,包括 Cosmos 3 Edge、MiniMax-H3、Laguna S 2.1、DeepSeek-V4-Flash、Inkling-Small、Wan-Animate-2 和 LTX-2.5,并支持 Meta 的 Muse Glimmer 模型。这些模型和工具旨在推动本地 AI 和智能代理的发
vLLM 发布 v0.27.0 版本,包含 561 个提交,来自 242 位贡献者。该版本新增对 Kimi K3、Qwen3.5、K-EXAONE-2.0 等模型的支持,并升级至 PyTorch 2.13.0,深化 FlashAttention 4 集成,优化 DeepSeek-V4 性能,扩展 Model Runner V2 至非生成任务,并引入容错框架和
Deepwen 3.6 是基于 Qwen3.6-35B-A3B 的微调模型,融合了 DeepSeek-V4-Flash-0731 的推理能力,专注于 AAA 游戏开发、3D 生成和 Web 图形。该模型提供了多种 MoQ 量化版本,并附带多模态投影器。其改进包括程序化生成、硬表面建模、Blender 工作流等,且保留了 Qwen 的原始能力。
llama.cpp 发布 b10305 版本,主要更新是在 SYCL 后端支持 DeepSeek V4 的多个算子(LIGHTNING INDEXER、DSV4 HC COMB、DSV4 HC POST、DSV4 HC PRE),并更新了 ops.md 文档。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler
Together AI 对 DeepSeek-V4 Flash 0731 和 GPT-5.6 Luna 在 DeepSWE 基准上进行了 900 次测试。Luna 在 pass@1 上领先 14 个百分点(67.2% vs 53.3%),但 DeepSeek 成本仅为 Luna 的六分之一,每美元解决任务数是 Luna 的 4.8 倍。采用 DeepSeek
PydanticAI 发布 v2.26.0 版本,新增了隐藏工具函数、首次运行取消、提示缓存保留解析等多项功能,并修复了多个 bug。该版本还支持 DeepSeek V4 Flash 模型,并改进了 OpenRouter 的流式推理细节处理。
AI 工具公司 Composio 测试了 DeepSeek V4 Flash 在四个代理框架(Claude Code、Codex、OpenCode 和 Oh My Pi)上的表现,使用 Gmail、GitHub、Slack 和 Notion 等真实工具执行 30 项任务。结果显示,没有单一框架在所有类别中胜出:Oh My Pi 成功率最高(17/30)但速度
AtomicChat 发布了 DeepSeek-V4-Flash-0731 的 GGUF 量化版本,该模型为 284B 参数的 MoE 模型,已进行量化感知训练,专家权重以 MXFP4 存储。文章提供了详细的量化质量对比表,显示在相同大小下其量化版本优于 unsloth 的版本,并警告 GGUF 文件中的聊天模板已过时,需手动替换以避免推理能力下降。
bartowski 使用 llama.cpp b10173 对 deepseek-ai 的 DeepSeek-V4-Flash-0731 模型进行了量化,发布了 GGUF 格式的 MXFP4 版本,文件大小为 156.38GB。该模型拥有 284B 参数,目前仅提供 MXFP4 格式,其他量化大小可能后续推出。用户可通过 llama.cpp、LM Studi
Hugging Face 每日论文发布了一项研究,指出大型语言模型在代码编辑中存在“删除回避”问题,即系统性地保留本应删除的代码。研究显示,在 SWE-bench Verified 基准上,五个领先模型对开发者补丁的删除召回率最高仅 71.7%,且 29% 的通过补丁采用“Guard-and-Go”模式,通过保留代码并添加守卫来通过测试。研究者构建了 Can
llama.cpp 发布 b10254 版本,主要更新是为 DeepSeek V4 Flash 0731 模型添加新的聊天模板,并调整了 DeepSeek V4 模板以对齐官方编码器,包括默认丢弃思考内容、支持结构化输出响应格式、新增 Flash 0731 模板等。该版本还提供了多平台二进制文件下载。
该研究探讨了使用廉价开源权重模型作为自然语言数学证明的自动评判者。在IMO-GradingBench的200个实例验证样本上,三个廉价评判模型(GPT-OSS 120B、DeepSeek-V4 Flash、Gemma-4 31B)与人类通过/失败判断的一致性在统计上与Claude Opus 4.7和Gemini 3.1 Pro等前沿模型相当,但成本低至100
llama.cpp 发布 b10232 版本,主要更新是在 Metal 后端实现了 DeepSeek V4 的超连接(hyper-connections)支持,包括新增 GGML OP DSV4 HC COMB、GGML OP DSV4 HC PRE 和 GGML OP DSV4 HC POST 算子,并针对 SIMDgroup 寄存器与 shuffle 进