✷ 归档 · 11 个实验室 · 3,058 篇 dispatch
实验室
不用每天手动刷十几个官方博客。OpenAI、Anthropic、DeepMind 等实验室的一手发布,每篇都提炼出核心内容。
你本来可以设计出最先进的位置编码
Hugging Face 博客文章逐步介绍了 Transformer 的位置编码的迭代设计,展示了正弦编码如何导致旋转位置编码(RoPE),以及它为何对建模 token 关系很重要。
Anthropic Model Context Protocol (MCP) 发布
Anthropic 开源了 Model Context Protocol (MCP),这是一个连接 AI 助手与内容仓库、业务工具和开发环境等数据源的通用标准,旨在消除碎片化的集成方式。
Ollama Python 库 0.4 版本发布说明
Ollama Python 库 0.4 引入了直接传递 Python 函数作为工具的功能,并通过 Pydantic 和文档字符串解析自动生 JSON 模式。
Anthropic 与 AWS 扩大 AI 开发合作伙伴关系
Anthropic 与 AWS 扩大了合作,包括 Amazon 的一项新的 40 亿美元投资,以及旨在为未来基础模型优化 Trainium 硬件的深度技术合作伙伴关系。
结合人员与 AI 推进红队工作 – OpenAI 的方法及其在 o1 系列上的应用
OpenAI 发布了一份白皮书,详细阐述了其针对 AI 模型的外部红队流程,并将其应用于为 OpenAI o1 系列模型的公开发布做准备。
Grab GPT-4o 视觉微调 用于 GrabMaps
Grab 已实施 GPT-4o 视觉微调,以自动化 GrabMaps 中交通标志和车道计数的定位,使限速标志定位提高了 13%,车道计数准确性提高了 20%。
Hugging Face 和 LLM-jp 发布开放的日语 LLM 排行榜
Hugging Face 和 LLM-jp 推出了开放的日语 LLM 排行榜,这是一个透明的评估平台,包含超过 20 个数据集,用于基准测试日语大型语言模型的性能。
Hugging Face 引入内容定义分块以提升存储效率
Hugging Face 通过其 Xet 团队宣布了一种内容定义分块存储方法,通过仅上传已修改的块来降低大型模型和数据集文件的存储和传输成本。
使用自推测解码的更快文本生成
Hugging Face 通过 LayerSkip 引入了自推测解码,这是一种使用单个 LLM 的早期层进行草稿、后期层进行验证的方法,以提高生成速度并降低内存开销。
FlagEval 辩论:一种新的多语言 LLM 评估框架
BAAI 已推出 FlagEval 辩论,一个动态评估平台,LLM 在其中进行多语言辩论,以更好地评估推理、逻辑和对抗能力。
Rox 收入平台与 OpenAI 集成
Rox 使用 OpenAI 的 API 推出了一款 AI 驱动的收入管理平台,通过 AI 代理群系统自动化数据统一、销售工作流程和账户监控。
Hugging Face Judge Arena: 将 LLM 作为评估器进行基准测试
Hugging Face 推出了 Judge Arena,这是一个通过人类投票来确定哪些 LLM 在评估其他 AI 生成的响应方面最有效的众包平台。
Anthropic 模型评估的统计方法
Anthropic 提出了一套严谨的 AI 模型评估统计框架,利用中心极限定理和功效分析等工具,将真实的性能差异与随机噪声区分开来。
Mistral AI le Chat 更新 2024 年 11 月
Mistral AI 为 le Chat 引入了多项测试版功能,包括带有引用的网络搜索、协作式 Canvas 界面,以及由 Pixtral Large 驱动的多模态能力。
Pixtral Large 发布说明
Mistral AI 发布了 Pixtral Large,这是一个 1240 亿参数的开源多模态模型,在 MathVista、DocVQA 和 VQAv2 上均达到顶尖性能,同时保持了 Mistral Large 2 的文本处理能力。
OpenAI 在巴黎开设办事处以扩展法国 AI 生态系统
OpenAI 已在巴黎开设新办事处,以支持法国组织、初创公司和政府合作中 AI 的快速采用。
Qwen2.5-Turbo 1M Token 上下文长度发布
Qwen 发布了 Qwen2.5-Turbo,将模型的上下文窗口扩展到 100 万个 token,同时显著提升推理速度,并在短序列任务上保持竞争力的性能。
雅诗兰黛公司 ChatGPT Enterprise 实施
雅诗兰黛公司已部署 ChatGPT Enterprise 来分析超过75年的消费者和临床数据,创建了超过240个自定义 GPT,以加速产品开发和市场响应能力。
面向研究者的 Hugging Face Hub 数据集共享
Hugging Face Hub 提供一个综合平台,用于托管和共享大规模 ML 数据集,集成了用于探索、安全和社区参与的工具。
Qwen2.5-Coder 系列发布说明
Qwen 发布了 Qwen2.5-Coder 系列,包含从 0.5B 到 32B 的六种模型规模,其中 32B-Instruct 模型在编码任务上实现了与 GPT-4o 相当的开源 SOTA 性能。
Mistral Batch API 发布
Mistral AI 推出了 Batch API,允许用户以比同步 API 调用低 50% 的成本来处理海量请求。
Mistral Moderation API 发布
Mistral AI 发布了新的内容审核 API,这是一款基于 LLM 的分类器,可将文本分为多种语言的九个安全类别,为 AI 部署提供系统级护栏。
Llama 3.2 Vision 已可在 Ollama 中使用
Ollama 已发布对 11B 和 90B 参数规模 Llama 3.2 Vision 的支持,实现了包括 OCR 和图像分析在内的多模态能力的本地执行。
Hugging Face PyCharm 集成
Hugging Face 已将其 Hub 直接集成到 PyCharm Professional 中,允许开发人员在不离开 IDE 的情况下发现、插入和管理机器学习模型。
Argilla 2.4 发布说明 / 新功能
Argilla 2.4 引入了一个无需编码的 UI,用于导入 Hugging Face Hub 数据集,以通过人工反馈构建微调和评估数据集。
xAI API 公测发布
xAI 已推出其 API 的公测版本,为开发者提供对 Grok 系列基础模型的程序化访问权限,并从 grok-beta 模型开始。
Claude 3 Haiku 在 Amazon Bedrock 中的微调
Anthropic 已在 Amazon Bedrock 中正式推出 Claude 3 Haiku 的微调功能,允许用户针对专业任务定制模型,以实现更高的准确性和更低的成本。
介绍 ChatGPT 搜索
OpenAI 已在 ChatGPT 中集成了全新网页搜索功能,使用户能够获得快速、及时的答案,并直接链接到相关的网络来源。
Promega ChatGPT 采用案例研究
Promega 已在整个组织中整合了 ChatGPT,部署了超过 1,400 个自定义 GPT,以加速制造、销售和营销工作流程。
Anthropic: 支持针对性 AI 监管的理由
Anthropic 主张在未来 18 个月内对前沿 AI 模型实施紧急且针对性强的政府监管,以减轻灾难性的网络安全和 CBRN 风险,同时保留创新能力。
OpenAI SimpleQA 基准发布
OpenAI 发布了 SimpleQA,这是一套包含 4,326 条简短求事实问题的开源基准,用于评估前沿语言模型的事实准确性和校准能力。
Decagon 与 OpenAI 的客户支持自动化
Decagon 采用包含 GPT-3.5、GPT-4 和 o1-mini 的多模型策略,实现对企业客户高达 91% 的全球支持自动化。
通用辅助生成:使用任意助手模型实现更快解码
Hugging Face 与 Intel Labs 推出了通用辅助生成(UAG),这是一种通过允许任何小模型充当助手(不受其分词器限制)来将大语言模型推理加速 1.5 倍至 2.0 倍的方法。
Claude 3.5 Sonnet 与 GitHub Copilot 集成
Anthropic 的 Claude 3.5 Sonnet 现已在 GitHub Copilot 上提供公共预览版,为开发者提供高性能的编程模型,其在 SWE-bench Verified 上表现优于其他公开可用的模型。
Digital Green Farmer.chat:通过 LLM‑as‑a‑Judge 加强 RAG
Digital Green 为 Farmer.chat(基于 RAG 的农业聊天机器人)实现了 LLM‑as‑a‑Judge 评估框架,以客观衡量 RAG 准确性并在 34 万条查询中优化模型选择。
Anthropic 评估特征转向:缓解社会偏见的一个案例研究
Anthropic 研究人员发现,虽然特征转向可以针对 Claude 3 Sonnet 中的特定社会偏见和政治立场,但它经常会产生不可预测的脱靶效应,并在特定的转向因子范围之外降低模型能力。
Aya Expanse 发布:推动多语言大语言模型性能提升
Hugging Face 和 Cohere For AI 已发布 Aya Expanse,这是一系列 8B 和 32B 开源权重模型,创下了多语言性能的新最先进基准。
简化、稳定并扩展连续时间一致性模型
OpenAI 推出 sCM,这是一种简化的连续时间一致性模型,仅需两步采样即可实现与扩散模型相当的样本质量,生成速度提升约 50 倍。
HUGS 发布:零配置、硬件优化的开源 LLM 推理
Hugging Face 推出 HUGS,这是一项零配置、硬件优化的开源 LLM 推理服务,支持 NVIDIA、AMD,未来还将支持 AWS Inferentia 和 Google TPU,使企业能够在内部托管模型,并提供兼容 OpenAI 的 API。
CinePile 2.0 发布:对抗性细化提升视频问答数据集质量
CinePile 2.0 引入了对抗性细化流水线,将薄弱的 QA 对升级为依赖视觉的问题,发布了改进后的数据集和完整代码,并展示了商业和开源视频‑LLM 的显著性能提升。
SynthID 文本集成于 Transformers v4.46.0
Google DeepMind 与 Hugging Face 已将 SynthID Text 集成到 Transformers v4.46.0 中,提供了一种对 AI 生成文本添加不可感知水印并通过训练分类器进行检测的方法。
OpenAI 与微软与 Lenfest Institute 合作的 AI 协作与奖学金项目
OpenAI 与微软已与 Lenfest Institute for Journalism 合作,提供 1000 万美元的资金和信用额度,帮助本地新闻编辑部实施 AI,以实现业务可持续性和创新。
在 Hugging Face 推理端点上部署语音到语音
Hugging Face 提供了一份指南,说明如何使用自定义 Docker 镜像在 Inference Endpoints 上部署其 Speech-to-Speech(S2S)流水线,以应对高计算需求并降低延迟。
Outlines-core 0.1.0 发布说明 / 新功能
Hugging Face 和 dottxt 已发布 outlines-core 0.1.0,这是 Outlines 核心算法的 Rust 移植版,用于结构化生成,提升了索引编译速度和可移植性。
Stable Diffusion 3.5 Large 与 Diffusers 的集成
Hugging Face 已将 Stable Diffusion 3.5 Large(一个 8B 参数模型,提供标准版和时间步蒸馏版)集成到 Diffusers 库中。
Hugging Face 与 Protect AI 合作,为模型安全添加 Guardian 扫描器
Hugging Face 与 Protect AI 合作,将 Guardian 扫描器嵌入 Hub,自动检测危险的模型序列化漏洞,提升整个机器学习社区的安全性。
Transformers.js v3 发行版添加了 WebGPU 加速、扩展的模型支持以及服务器端 JavaScript 兼容性
Transformers.js v3 添加了 WebGPU 加速、新的量化格式、支持 120 种模型架构,并兼容 Node.js/Deno/Bun,使得在浏览器和 JavaScript 运行时实现快速的设备端推理成为可能。
Anthropic Claude 3.5 Sonnet and Claude 3.5 Haiku 发布
Anthropic 发布了升级版的 Claude 3.5 Sonnet 和全新的 Claude 3.5 Haiku,同时还为一项突破性的 "computer use" 能力推出了公开测试版,该能力允许模型与标准计算机界面进行交互。
Keras 中的 Llama 3.2
通过 keras-hub,Keras 完全支持 Llama 3.2,用户可以加载 Hugging Face 检查点,并在 JAX、PyTorch 或 TensorFlow 后端上运行模型。
Ollama 上的 IBM Granite 3.0 模型
IBM Granite 3.0 模型(包括稠密模型和混合专家 MoE 变体)现已在 Ollama 上通过 Apache 2.0 许可提供。