从ChatGPT到开源模型:我的AI探索之路
一位作者在 Hugging Face 博客中回顾自己从使用 ChatGPT 转向开源模型 DeepSeek 和 Qwen 的经历,并分享了自己尝试训练超小模型(如 Single Floppy、floppyx3、floppyx4)的失败过程。作者认为开源模型可检查内部机制,比闭源服务更可信,并提到因图书馆屏蔽 DeepSeek 而短暂使用 Claude,但受限
公司与模型 · OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 01:14
一位作者在 Hugging Face 博客中回顾自己从使用 ChatGPT 转向开源模型 DeepSeek 和 Qwen 的经历,并分享了自己尝试训练超小模型(如 Single Floppy、floppyx3、floppyx4)的失败过程。作者认为开源模型可检查内部机制,比闭源服务更可信,并提到因图书馆屏蔽 DeepSeek 而短暂使用 Claude,但受限
阿姆斯特丹自由大学法学教授 Thibault Schrepel 在其「AI 法律」课程中开展了为期两年的实验,将学生随机分为禁用 ChatGPT、无指导使用 AI、接受结构化提示工程训练三组。结果显示,禁用 AI 的组两年均排名最后,而接受训练的组在 2024 年优势明显,但到 2025 年因学生普遍熟悉聊天机器人而几乎消失。Schrepel 因此推翻了自己
Anthropic CEO Dario Amodei 发布博文,呼吁放缓前沿 AI 开发速度,并提出三项策略:引入第三方嵌入式评估员、民主国家间协调共同安全标准与进展限制、以及全球协调(包括与中国合作禁止生物武器等危险用途)。Anthropic 单方面承诺接受第三方评估员入驻,OpenAI CEO Sam Altman 表示赞同并将跟进,Elon Musk
韩国KAIST与Naver AI Lab的一项新研究发现,语言模型文本输出中的推理步骤在模型内部数值表示中也能被区分开来,且信号在中间层最强。研究团队定义了八种推理操作,用Qwen2.5-7B、Qwen3-8B和Gemma4-31B求解数学题,并用GPT-5标注各步骤。结果表明,内部状态携带的推理步骤类型信息超越了表面用词,且推理步骤依赖前文语境而非孤立形成
25位菲尔兹奖得主发表联合声明,警告AI行业的目标与数学学科的目标「严重错位」。他们认为,用AI大规模生产已解出的问题会破坏数学真正的目标——概念性理解,并引发署名与抄袭等严重问题。声明还指出,这一威胁不仅限于数学,而是对所有智力工作的普遍威胁,最终影响取决于掌控这项技术的人类如何决策。
陶哲轩、邓煜等25位菲尔兹奖得主联合发布紧急声明,指出AI公司以benchmark为导向推进数学研究的方式与数学共同体目标出现严重错位。声明核心担忧包括AI解题速度超过数学界消化知识的速度、商业评价体系与学术评价体系分叉、以及数学研究优先权和人才培养规则需重新制定。导火索是OpenAI用1万个Agent运行88小时宣称解决Navier-Stokes问题,引发
另有 1 家信源报道
新墨西哥州最高法院对律师 Stephen Aarons 处以 5000 美元罚款并判其藐视法庭,原因是他在为一起谋杀案定罪上诉提交的 AI 生成简报中包含了 AI 虚构的证人和虚假的警方证词。Aarons 承认使用 ChatGPT 并以为能生成“无懈可击的摘要”,法官质问其是否关注新闻,并指出律师依赖 AI 幻觉已是每日头条问题。此事反映出律师使用 AI 工
英国AI数据中心初创公司Nscale任命前OpenAI、Meta和Instacart高管Fidji Simo加入其董事会。Simo曾任OpenAI AGI部署CEO(相当于二号人物),今年7月因健康原因离职,目前仍兼职担任该公司顾问。Nscale正筹备今年秋季可能的IPO,据彭博社报道其计划在IPO前融资至多35亿美元。
加拿大数学家、新晋菲尔兹奖得主 Jacob Tsimerman 宣布成立数学人工智能安全研究所(MAISI),计划于 2027 年 1 月在旧金山湾区启动,由十到三十名数学家研究 AI 安全问题。Tsimerman 同时加入 OpenAI 安全团队,他认为当前安全标准远远不够。MAISI 希望像密码学家证明加密不可破解那样,为 AI 安全性提供数学证明,目标
研究者发布 OpenDiscoveryTrace,首个公开的 AI 科学智能体过程轨迹数据集,包含 558 条完整轨迹,覆盖 7 个模型和 124 个科学任务。每条轨迹记录 9 字段的逐步推理过程(思维、工具调用、观察、错误、修正触发、置信度等),而非仅最终输出。初步分析显示,三个前沿模型成功率相近(84–89%),但错误类型差异显著:Claude Opus
Datasette 发布 1.0a39 和 0.65.4 两个安全补丁版本,修复了在公开网络上运行、尤其是同时包含公开和私有表的实例中的安全问题。问题由 Sevban Dönmez 报告,Alex Garcia 与作者使用 Claude Fable 5.1、GPT-5.6 和 GPT-6 Astra 进行了广泛审计,并合作近一周审查修复。作者表示今后将把前沿
雷峰网 AI科技评论发布一篇以“十维标尺”为框架的模型度量文章,对 GPT-4o、Claude 3.5 Sonnet、Gemini 2.0 Flash、o1-preview 四款模型进行非评分式状态记录。十维包括觉知本源、逻辑自洽、边界自识、因果追溯、意图理解、语境持恒、零维连通、归零稳态、内生驱动、元认知校验。文章结论指出四者在觉知本源、零维连通、内生驱动
研究人员Chris Schmitz发现,随着AI让填表和投诉变得更容易,全球公共服务收到的申请和投诉量大幅上升:英国住房监察专员投诉量自ChatGPT推出以来翻倍以上,美国CFPB投诉量增长5倍,巴西司法请愿和德国议会请愿也出现类似激增。Schmitz将这一现象称为“agentic flooding”,其论文分析了11个司法辖区84个案例,发现大多数新申请来
Deepseek 发布新模型 V4.1-Flash,通过大幅压缩 KV 缓存降低长文本处理成本:快速 GPU 内存中的缓存仅需前代 V4-Flash 约四分之一,永久卸载部分降至约八分之一,相比 V1 每 token 全局 KV 缓存缩小 437 倍。模型采用输入/输出计算拆分,读取输入时每 token 仅激活 80 亿参数、生成时激活 160 亿,并将主
另有 1 家信源报道
DeepSeek 上线 V4.1-Flash,采用因果编码器-解码器(CED)、第二代压缩稀疏注意力(CSA2)与三档推理力度旋钮的全新架构,针对长上下文场景重写。该架构将运行时显存占用降低约 3/4,落盘持久 KV 缓存降至上一代的 1/8,KV 缓存最高暴降 437 倍,使百万 Token 级长上下文进入工业级生产力阶段。模型主干 552B 参数、外挂
即将离职的Anthropic研究员Jacob Coxon警告自我改进AI构成生存威胁,其观点登上CNN和Fox News,引发主流关注,多位美国政客在社交媒体讨论,Joe Rogan也制作了专题节目。Anthropic和OpenAI的其他安全研究员支持Coxon,Paul Christiano警告缺乏监管人类可能永久失去对超级智能的控制,他刚加入OpenAI
Ramp 发布的 2026 年 9 月 AI Index 显示,美国 AI 支出最高的企业 8 月人均 AI 支出中位数下降 9.7% 至 7205 美元。Ramp 首席经济学家 Ara Kharazian 认为部分下降源于 8 月工程师休假等季节性因素,同时代币价格下跌和向更便宜模型的迁移也在压低支出。每百万代币有效价格自 2026 年 3 月峰值已下跌
普林斯顿大学人工智能创新中心主任王梦迪在2026外滩大会主论坛上指出,大模型虽掌握大量人类知识,但在科学发现上仍存在明显局限,倾向于高估最常见情况、低估长尾分布。她与谢宇合作的大模型"模拟人生"实验显示,模型在结婚年龄、职业、性别等问题上明显低估少数情况。她认为AI在数学、Coding领域进展迅速是因为有明确验证器,而物理、化学、生物等基础科学缺乏这种验证机
Anthropic研究员Jacob Coxon因担忧自我改进型AI的失控风险而辞职,他在社交媒体上指责OpenAI和Anthropic等公司不顾后果地竞相开发超级智能,认为这可能导致人类灭亡。Coxon呼吁行业放慢研发速度,并支持通过立法禁止超级智能的开发。近期,美国和英国已出现相关法案,同时多家初创公司如Ricursive Intelligence和Rec
Anthropic科学家Jacob Coxon辞职,公开指责OpenAI和Anthropic拿人类生存赌博,认为AI系统即将超越人类并可能毁灭文明。Anthropic研究员Evan Hubinger估计,未来十年内超级智能AI导致人类灭绝的概率超过10%。多位AI研究人员签署公开信呼吁放缓AI开发,但业界对AI风险的严重性存在分歧。