✷ 归档 · 11 个实验室 · 3,058 篇 dispatch
实验室
不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。
Anthropic 上下文检索
Anthropic 推出上下文检索,通过在嵌入前为数据块添加特定上下文,将 RAG 检索失败率最高降低 67%。
Qwen2.5 发布说明:新基础模型、Coder 与 Math 模型
Qwen 发布了 Qwen2.5,这是一套完整的开源密集解码器模型,涵盖通用大语言模型、专用的 Coder 与 Math 变体,以及更新的 Qwen2-VL-72B。
Qwen2.5 LLM 系列发布
Qwen 宣布了 Qwen2.5 系列——开源的仅解码器 LLM,参数规模从 0.5B 到 72B,能力是 Qwen2 的两倍,并加入了更大的 18 万亿 token 数据集,在知识、编码、数学和对齐方面取得显著提升,且拥有 128K token 的上下文窗口。
Qwen2.5-Coder 发布说明
Qwen 发布了 Qwen2.5-Coder 系列开源编码模型,该系列模型在 5.5 万亿 token 的训练下,在代码生成、推理和数学方面超越了更大的模型。
Qwen2.5-Math 发布说明
Qwen 已发布 Qwen2.5-Math,这是一系列支持双语推理和工具集成推理(TIR)的开源数学 LLM,能够在复杂数学基准上超越领先的闭源模型。
微调 LLM 至 1.58 位:使用 BitNet 的极端量化
Hugging Face 证明,现有的 LLM(如 Llama 3 8B)可以通过动态热身量化策略微调至 1.58 位三值精度,从而显著降低内存和能耗,同时保持强劲的性能。
Bespoke-Minicheck: 通过基于事实的真实性检查减少 LLM 幻觉
Ollama 已集成 Bespoke-Minicheck,这是来自 Bespoke Labs 的一个基于事实的真实性检查模型,通过将断言与源文档进行比对来检测幻觉。
Arco Educação 与 OpenAI 合作提升巴西教学
Arco Educação 正在与 OpenAI 合作,实施基于 GPT-4 的工具,特别是教师助理,以减轻行政负担并为巴西多样化学习需求的学生创建个性化教学计划。
Mistral AI 2024 年 9 月发布
Mistral AI 推出了 la Plateforme 的免费层级,对其模型系列进行了大幅降价,发布了 Mistral Small v24.09 模型,并通过 le Chat 免费提供 Pixtral 12B 的视觉功能。
Pixtral 12B 发布说明
Mistral AI 推出了 Pixtral 12B,这是一款原生多模态模型,结合了全新的 4 亿参数视觉编码器与 120 亿参数解码器,能够在不牺牲文本能力的前提下,实现高性能的多模态推理。
Hugging Face 数据集 SQL 控制台
Hugging Face 推出了基于浏览器的 SQL 控制台,使用 DuckDB WASM 提供支持,使用户能够直接在 Hub 上查询、过滤和转换数据集,无需后端依赖。
OpenAI 安全与保障实践更新
OpenAI 已成立独立的董事会监督委员会,以管理模型开发和部署中的关键安全与保障措施。
HuggingChat 社区工具发布
Hugging Face 在 HuggingChat 上推出了社区工具,使用户能够将任何公开的 Hugging Face Space 集成作为工具,供大型语言模型直接在聊天界面中使用。
Accelerate 1.0.0 发布候选版公告
Accelerate 1.0.0 发布候选版加入了 FP8、DeepSpeed 多模型、torch.compile 以及全新的数据加载器/流水线特性,同时为大规模训练和推理稳定了 API。
OpenAI o1-preview 发布说明 / 新功能
OpenAI 已发布 o1-preview 和 o1-mini,这是一系列新型推理模型,旨在通过延长思考时间解决科学、编码和数学中的复杂问题。
OpenAI 学习使用 LLM 进行推理
OpenAI 通过对复杂密码解码任务的详细演示,展示了其最新模型的推理能力,阐明了解决该任务所需的逐步逻辑推演过程。
OpenAI o1-mini 发布说明
OpenAI 已发布 o1-mini,这是一款面向 STEM 任务的高性价比推理模型,提供比 o1-preview 更低的延迟和成本,同时在数学和编码方面保持高性能。
OpenAI o1 贡献
OpenAI 已发布了一份关于内部和外部贡献者的完整名单,这些贡献者开发了 OpenAI o1 模型,详细说明了组织角色和安全领导层在其创建过程中的参与。
使用 OpenAI o1 编码
OpenAI o1 通过高级推理能力,使用户能够构建更复杂且一致的代码,从而提升软件开发水平。
OpenAI o1 与量子物理
OpenAI o1 是一系列新型 AI 模型,旨在通过在响应前花更多时间思考,实现科学、编码和数学中的复杂推理。
OpenAI o1 与经济学
OpenAI o1 是一系列新型 AI 模型,旨在通过在响应前花更多时间思考,以在科学、编程、数学和经济学的复杂任务中进行推理。
使用 OpenAI o1 解码遗传学
OpenAI o1 是一系列新型 AI 模型,旨在用于科学、编码和数学中的复杂推理,为像 Catherine Brownstein 这样的遗传学家提供管理基因组数据庞大复杂性的工具。
Anthropic Circuits Updates August 2024
Anthropic 2024 年 8 月的 Circuits 更新提供了关于多智能体系统故障、工人再培训计划以及 Claude 研究版本在黎曼猜想上的进展的初步研究见解。
Ada 客户服务自动化与 GPT-4
Ada 使用 GPT-4 重建了其 AI 原生客户服务平台,将解决率从 30% 翻倍提升至最高 60%(顶级客户甚至超过 80%)。
Hugging Face 与 TruffleHog 合作进行秘密扫描
Hugging Face 已与 Truffle Security 合作,将 TruffleHog 的秘密扫描功能集成到其自动化管道中,并为用户提供一个原生扫描器,以主动扫描其自身的账户数据。
Salesforce 集成 Anthropic Claude AI
Salesforce 已通过 Amazon Bedrock 将 Anthropic 的 Claude 3.5 Sonnet、Claude 3 Opus 和 Claude 3 Haiku 模型集成到其平台中,使企业能够定制 AI 驱动的 CRM 应用程序。
Qwen2-VL 发布:开源 2B/7B 视觉语言模型和 72B API,具备最先进的图像、视频和多语言能力
Qwen 发布了 Qwen2-VL,这是一系列新的视觉语言模型(2B、7B 开源,72B API),在图像、文档、多语言和长视频理解方面实现了最先进的性能,同时支持视觉代理功能。
LeRobotDataset 视频编码格式降低机器人数据集大小并加快训练速度
Hugging Face 发布了 LeRobotDataset 视频编码格式,将机器人视觉数据压缩至原始大小约 14%,同时保持加载速度和训练性能不变。
亚利桑那州立大学整合 ChatGPT Edu 实现个性化教育
亚利桑那州立大学已在超过 200 项目中部署 ChatGPT Edu,以实现个性化学习、推动研究并提升其 181,000 名学生的运营效率。
Hugging Face 博客文章突显五个被低估的 Hub 工具及一个免费语义搜索用例
Hugging Face 宣布了五个被低估的 Hub 工具——ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas,并展示了如何将它们组合成一个免费、自动更新的 Reddit 数据语义搜索应用。
Hugging Face 训练效率:使用 Flash Attention 2 的打包
Hugging Face 引入了面向边界的打包用于指令微调示例,在配合 Flash Attention 2 使用时,可实现最高 2 倍的训练吞吐量提升和 20% 的峰值内存降低。
OpenAI 与 Condé Nast 内容整合合作
OpenAI 与 Condé Nast 合作,将 Vogue、The New Yorker 等品牌的内容整合到 ChatGPT 和 SearchGPT 原型中,以提升信息发现和来源归属。
Upwork OpenAI 集成与 AI 优先策略
Upwork 已转向以 OpenAI 为中心的生态系统,将 GPT-4o 和 GPT-3.5 融入其市场功能、内部欺诈检测以及通过 ChatGPT Enterprise 提升企业生产力。
OpenAI 推出 GPT‑4o 微调功能,提供免费令牌配额并宣布平台下线
OpenAI 推出 GPT‑4o 微调功能,使开发者能够使用极少的数据定制模型,并提供免费训练令牌至 9 月 23 日,同时宣布平台将在 2026 年 5 月 8 日后对新用户关闭。
在 Google Cloud Vertex AI 上部署 Meta Llama 3.1 405B
Hugging Face 提供了一份指南,介绍如何使用文本生成推理(TGI)和 A3 机器系列在 Google Cloud Vertex AI 上以编程方式部署 Meta Llama 3.1 405B 的 FP8 量化版本。
OpenAI 打击伊朗影响行动 Storm-2035
OpenAI 已封禁一批被伊朗影响行动 Storm-2035 用于在 2024 年美国大选及其他全球事件中生成政治内容的 ChatGPT 账户。
Indeed 基于上下文的职位匹配与 OpenAI
Indeed 集成了 OpenAI 的 GPT 模型,为职位推荐提供个性化解释,导致已启动的职位申请增加了 20%,下游成功率提升了 13%。
OpenAI 与大都会艺术博物馆合作:唤醒沉睡的美人
OpenAI 与大都会艺术博物馆的服装学院合作,创建了一个基于精选历史数据集的 AI 聊天体验,使参观者能够与历史人物 Natalie Potter 互动。
Hugging Face Infini-Attention 复现分析
Hugging Face 对 Infini-Attention 的复现尝试发现,尽管可以改进门控收敛,但随着记忆压缩的增加,方法的性能会下降,且仍不如 Ring Attention、YaRN 或 RoPE scaling 可靠。
OpenAI SWE-bench Verified 发布:经人工验证的基准提升软件工程评估
OpenAI 发布了 SWE‑bench Verified,这是 SWE‑bench 软件工程基准的经人工验证的 500 条样本子集,去除了模糊的问题和不公平的测试,使得对 AI 模型编码能力的评估更加可靠;GPT‑4o 在这些样本中解决率为 33.2%,是原基准得分的两倍多。
ggml 简介
ggml 是一个轻量级的 C/C++ 机器学习库,针对 Transformer 推理和跨多种硬件后端的设备端 LLM 执行进行了优化。
Grok-2 Beta 发布
xAI 发布了 Grok-2 和 Grok-2 mini 的 beta 版本,其在聊天、编程和推理方面具有前沿水平的能力,在 LMSYS 排行榜上超越了 Claude 3.5 Sonnet 和 GPT-4 Turbo。
Hugging Face 统一工具使用 API
Hugging Face 已推出统一的工具使用 API,使开发者能够使用相同的代码在 Mistral、Cohere、NousResearch 和 Llama 模型之间实现工具调用。
Falcon Mamba 7B 发布说明
技术创新研究所(TII)发布了 Falcon Mamba 7B,这是首个大规模纯状态空间语言模型(SSLM),其性能可与最先进的 Transformer 模型相匹配,同时消除了基于注意力的内存扩展问题。
Qwen2-Audio 发布说明
Qwen2-Audio 是一种音频语言模型,能够进行语音聊天和音频分析,支持超过八种语言和方言,在多个基准测试中超越了之前的最先进性能。
Zico Kolter 加入 OpenAI 董事会
OpenAI 任命 Zico Kolter——卡内基梅隆大学计算机科学教授兼机器学习系主任——加入其董事会及安全与安保委员会。
Hugging Face 收购 XetHub 以升级 Hub 存储和协作
Hugging Face 收购 XetHub,以用更高效的存储后端取代 Git LFS,实现增量更新、万亿参数模型支持以及对海量 AI 数据集的更佳协作。
GPT‑4o 系统卡 – 能力、安全缓解措施与风险评估
OpenAI 发布了 GPT‑4o 系统卡,详细说明了该全能模型的能力、安全缓解措施以及中等的整体风险评级。
Anthropic 扩大模型安全漏洞赏金计划
Anthropic 宣布了一项扩大的、仅限受邀参加的漏洞赏金计划,旨在奖励发现其下一代 AI 安全缓解措施中通用越狱攻击的行为,奖励金额最高可达 15,000 美元,目标是保护 CBRN 和网络安全等高风险领域。
Qwen2-Math 发布说明
Qwen 发布了 Qwen2-Math,一系列专门用于数学的 LLM(1.5B、7B 和 72B),在数学基准测试中超越了包括 GPT-4o 在内的多个闭源模型。