归档 · 11 个实验室 · 3,058 篇 dispatch

实验室

不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。

2051

Anthropic 上下文检索

Anthropic 推出上下文检索,通过在嵌入前为数据块添加特定上下文,将 RAG 检索失败率最高降低 67%。

2052

Qwen2.5 发布说明:新基础模型、Coder 与 Math 模型

Qwen 发布了 Qwen2.5,这是一套完整的开源密集解码器模型,涵盖通用大语言模型、专用的 Coder 与 Math 变体,以及更新的 Qwen2-VL-72B。

2053

Qwen2.5 LLM 系列发布

Qwen 宣布了 Qwen2.5 系列——开源的仅解码器 LLM,参数规模从 0.5B 到 72B,能力是 Qwen2 的两倍,并加入了更大的 18 万亿 token 数据集,在知识、编码、数学和对齐方面取得显著提升,且拥有 128K token 的上下文窗口。

2054

Qwen2.5-Coder 发布说明

Qwen 发布了 Qwen2.5-Coder 系列开源编码模型,该系列模型在 5.5 万亿 token 的训练下,在代码生成、推理和数学方面超越了更大的模型。

2055

Qwen2.5-Math 发布说明

Qwen 已发布 Qwen2.5-Math,这是一系列支持双语推理和工具集成推理(TIR)的开源数学 LLM,能够在复杂数学基准上超越领先的闭源模型。

2056

微调 LLM 至 1.58 位:使用 BitNet 的极端量化

Hugging Face 证明,现有的 LLM(如 Llama 3 8B)可以通过动态热身量化策略微调至 1.58 位三值精度,从而显著降低内存和能耗,同时保持强劲的性能。

2057

Bespoke-Minicheck: 通过基于事实的真实性检查减少 LLM 幻觉

Ollama 已集成 Bespoke-Minicheck,这是来自 Bespoke Labs 的一个基于事实的真实性检查模型,通过将断言与源文档进行比对来检测幻觉。

2058

Arco Educação 与 OpenAI 合作提升巴西教学

Arco Educação 正在与 OpenAI 合作,实施基于 GPT-4 的工具,特别是教师助理,以减轻行政负担并为巴西多样化学习需求的学生创建个性化教学计划。

2059

Mistral AI 2024 年 9 月发布

Mistral AI 推出了 la Plateforme 的免费层级,对其模型系列进行了大幅降价,发布了 Mistral Small v24.09 模型,并通过 le Chat 免费提供 Pixtral 12B 的视觉功能。

2060

Pixtral 12B 发布说明

Mistral AI 推出了 Pixtral 12B,这是一款原生多模态模型,结合了全新的 4 亿参数视觉编码器与 120 亿参数解码器,能够在不牺牲文本能力的前提下,实现高性能的多模态推理。

2061

Hugging Face 数据集 SQL 控制台

Hugging Face 推出了基于浏览器的 SQL 控制台,使用 DuckDB WASM 提供支持,使用户能够直接在 Hub 上查询、过滤和转换数据集,无需后端依赖。

2062

OpenAI 安全与保障实践更新

OpenAI 已成立独立的董事会监督委员会,以管理模型开发和部署中的关键安全与保障措施。

2063

HuggingChat 社区工具发布

Hugging Face 在 HuggingChat 上推出了社区工具,使用户能够将任何公开的 Hugging Face Space 集成作为工具,供大型语言模型直接在聊天界面中使用。

2064

Accelerate 1.0.0 发布候选版公告

Accelerate 1.0.0 发布候选版加入了 FP8、DeepSpeed 多模型、torch.compile 以及全新的数据加载器/流水线特性,同时为大规模训练和推理稳定了 API。

2065

OpenAI o1-preview 发布说明 / 新功能

OpenAI 已发布 o1-preview 和 o1-mini,这是一系列新型推理模型,旨在通过延长思考时间解决科学、编码和数学中的复杂问题。

2066

OpenAI 学习使用 LLM 进行推理

OpenAI 通过对复杂密码解码任务的详细演示,展示了其最新模型的推理能力,阐明了解决该任务所需的逐步逻辑推演过程。

2067

OpenAI o1-mini 发布说明

OpenAI 已发布 o1-mini,这是一款面向 STEM 任务的高性价比推理模型,提供比 o1-preview 更低的延迟和成本,同时在数学和编码方面保持高性能。

2068

OpenAI o1 贡献

OpenAI 已发布了一份关于内部和外部贡献者的完整名单,这些贡献者开发了 OpenAI o1 模型,详细说明了组织角色和安全领导层在其创建过程中的参与。

2069

使用 OpenAI o1 编码

OpenAI o1 通过高级推理能力,使用户能够构建更复杂且一致的代码,从而提升软件开发水平。

2070

OpenAI o1 与量子物理

OpenAI o1 是一系列新型 AI 模型,旨在通过在响应前花更多时间思考,实现科学、编码和数学中的复杂推理。

2071

OpenAI o1 与经济学

OpenAI o1 是一系列新型 AI 模型,旨在通过在响应前花更多时间思考,以在科学、编程、数学和经济学的复杂任务中进行推理。

2072

使用 OpenAI o1 解码遗传学

OpenAI o1 是一系列新型 AI 模型,旨在用于科学、编码和数学中的复杂推理,为像 Catherine Brownstein 这样的遗传学家提供管理基因组数据庞大复杂性的工具。

2073

Anthropic Circuits Updates August 2024

Anthropic 2024 年 8 月的 Circuits 更新提供了关于多智能体系统故障、工人再培训计划以及 Claude 研究版本在黎曼猜想上的进展的初步研究见解。

2074

Ada 客户服务自动化与 GPT-4

Ada 使用 GPT-4 重建了其 AI 原生客户服务平台,将解决率从 30% 翻倍提升至最高 60%(顶级客户甚至超过 80%)。

2075

Hugging Face 与 TruffleHog 合作进行秘密扫描

Hugging Face 已与 Truffle Security 合作,将 TruffleHog 的秘密扫描功能集成到其自动化管道中,并为用户提供一个原生扫描器,以主动扫描其自身的账户数据。

2076

Salesforce 集成 Anthropic Claude AI

Salesforce 已通过 Amazon Bedrock 将 Anthropic 的 Claude 3.5 Sonnet、Claude 3 Opus 和 Claude 3 Haiku 模型集成到其平台中,使企业能够定制 AI 驱动的 CRM 应用程序。

2077

Qwen2-VL 发布:开源 2B/7B 视觉语言模型和 72B API,具备最先进的图像、视频和多语言能力

Qwen 发布了 Qwen2-VL,这是一系列新的视觉语言模型(2B、7B 开源,72B API),在图像、文档、多语言和长视频理解方面实现了最先进的性能,同时支持视觉代理功能。

2078

LeRobotDataset 视频编码格式降低机器人数据集大小并加快训练速度

Hugging Face 发布了 LeRobotDataset 视频编码格式,将机器人视觉数据压缩至原始大小约 14%,同时保持加载速度和训练性能不变。

2079

亚利桑那州立大学整合 ChatGPT Edu 实现个性化教育

亚利桑那州立大学已在超过 200 项目中部署 ChatGPT Edu,以实现个性化学习、推动研究并提升其 181,000 名学生的运营效率。

2080

Hugging Face 博客文章突显五个被低估的 Hub 工具及一个免费语义搜索用例

Hugging Face 宣布了五个被低估的 Hub 工具——ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas,并展示了如何将它们组合成一个免费、自动更新的 Reddit 数据语义搜索应用。

2081

Hugging Face 训练效率:使用 Flash Attention 2 的打包

Hugging Face 引入了面向边界的打包用于指令微调示例,在配合 Flash Attention 2 使用时,可实现最高 2 倍的训练吞吐量提升和 20% 的峰值内存降低。

2082

OpenAI 与 Condé Nast 内容整合合作

OpenAI 与 Condé Nast 合作,将 Vogue、The New Yorker 等品牌的内容整合到 ChatGPT 和 SearchGPT 原型中,以提升信息发现和来源归属。

2083

Upwork OpenAI 集成与 AI 优先策略

Upwork 已转向以 OpenAI 为中心的生态系统,将 GPT-4o 和 GPT-3.5 融入其市场功能、内部欺诈检测以及通过 ChatGPT Enterprise 提升企业生产力。

2084

OpenAI 推出 GPT‑4o 微调功能,提供免费令牌配额并宣布平台下线

OpenAI 推出 GPT‑4o 微调功能,使开发者能够使用极少的数据定制模型,并提供免费训练令牌至 9 月 23 日,同时宣布平台将在 2026 年 5 月 8 日后对新用户关闭。

2085

在 Google Cloud Vertex AI 上部署 Meta Llama 3.1 405B

Hugging Face 提供了一份指南,介绍如何使用文本生成推理(TGI)和 A3 机器系列在 Google Cloud Vertex AI 上以编程方式部署 Meta Llama 3.1 405B 的 FP8 量化版本。

2086

OpenAI 打击伊朗影响行动 Storm-2035

OpenAI 已封禁一批被伊朗影响行动 Storm-2035 用于在 2024 年美国大选及其他全球事件中生成政治内容的 ChatGPT 账户。

2087

Indeed 基于上下文的职位匹配与 OpenAI

Indeed 集成了 OpenAI 的 GPT 模型,为职位推荐提供个性化解释,导致已启动的职位申请增加了 20%,下游成功率提升了 13%。

2088

OpenAI 与大都会艺术博物馆合作:唤醒沉睡的美人

OpenAI 与大都会艺术博物馆的服装学院合作,创建了一个基于精选历史数据集的 AI 聊天体验,使参观者能够与历史人物 Natalie Potter 互动。

2089

Hugging Face Infini-Attention 复现分析

Hugging Face 对 Infini-Attention 的复现尝试发现,尽管可以改进门控收敛,但随着记忆压缩的增加,方法的性能会下降,且仍不如 Ring Attention、YaRN 或 RoPE scaling 可靠。

2090

OpenAI SWE-bench Verified 发布:经人工验证的基准提升软件工程评估

OpenAI 发布了 SWE‑bench Verified,这是 SWE‑bench 软件工程基准的经人工验证的 500 条样本子集,去除了模糊的问题和不公平的测试,使得对 AI 模型编码能力的评估更加可靠;GPT‑4o 在这些样本中解决率为 33.2%,是原基准得分的两倍多。

2091

ggml 简介

ggml 是一个轻量级的 C/C++ 机器学习库,针对 Transformer 推理和跨多种硬件后端的设备端 LLM 执行进行了优化。

2092

Grok-2 Beta 发布

xAI 发布了 Grok-2 和 Grok-2 mini 的 beta 版本,其在聊天、编程和推理方面具有前沿水平的能力,在 LMSYS 排行榜上超越了 Claude 3.5 Sonnet 和 GPT-4 Turbo。

2093

Hugging Face 统一工具使用 API

Hugging Face 已推出统一的工具使用 API,使开发者能够使用相同的代码在 Mistral、Cohere、NousResearch 和 Llama 模型之间实现工具调用。

2094

Falcon Mamba 7B 发布说明

技术创新研究所(TII)发布了 Falcon Mamba 7B,这是首个大规模纯状态空间语言模型(SSLM),其性能可与最先进的 Transformer 模型相匹配,同时消除了基于注意力的内存扩展问题。

2095

Qwen2-Audio 发布说明

Qwen2-Audio 是一种音频语言模型,能够进行语音聊天和音频分析,支持超过八种语言和方言,在多个基准测试中超越了之前的最先进性能。

2096

Zico Kolter 加入 OpenAI 董事会

OpenAI 任命 Zico Kolter——卡内基梅隆大学计算机科学教授兼机器学习系主任——加入其董事会及安全与安保委员会。

2097

Hugging Face 收购 XetHub 以升级 Hub 存储和协作

Hugging Face 收购 XetHub,以用更高效的存储后端取代 Git LFS,实现增量更新、万亿参数模型支持以及对海量 AI 数据集的更佳协作。

2098

GPT‑4o 系统卡 – 能力、安全缓解措施与风险评估

OpenAI 发布了 GPT‑4o 系统卡,详细说明了该全能模型的能力、安全缓解措施以及中等的整体风险评级。

2099

Anthropic 扩大模型安全漏洞赏金计划

Anthropic 宣布了一项扩大的、仅限受邀参加的漏洞赏金计划,旨在奖励发现其下一代 AI 安全缓解措施中通用越狱攻击的行为,奖励金额最高可达 15,000 美元,目标是保护 CBRN 和网络安全等高风险领域。

2100

Qwen2-Math 发布说明

Qwen 发布了 Qwen2-Math,一系列专门用于数学的 LLM(1.5B、7B 和 72B),在数学基准测试中超越了包括 GPT-4o 在内的多个闭源模型。