アーカイブ · ラボ 11 拠点 · ディスパッチ 450 件

ラボ

毎朝十数個の公式ブログを開いて回る必要はありません。OpenAI、Anthropic、DeepMind などの一次発表を、要点を抜き出した形で。

401

集団的憲法AI:パブリックインプットによる言語モデルの調整

AnthropicとCollective Intelligence Projectは、約1,000人の米国市民による憲法を用いて言語モデルを調整する手法を開発しました。その結果、企業内部の憲法で調整されたモデルよりも、社会的バイアスが低いモデルが実現しました。

402

Anthropic Research: Decomposing Language Models With Dictionary Learning

Anthropicの研究者は、辞書学習を用いて言語モデルの層を単一の意味を持つ特徴量に分解する手法を開発しました。これにより、個々のニューロンレベルでは不可視であった複雑なニューラルネットワークの活性化を解釈することが可能になります。

403

Anthropic、言語モデルを分解して理解可能なコンポーネントに分解する

Anthropicの研究者たちは、辞書学習を用いてニューラルネットワークの活性化を解釈可能な特徴量に分解する手法を開発しました。これにより、解釈不可能な個々のニューロンの限界を超えようとしています。

404

Anthropic: AIシステムの評価における課題

Anthropic は、堅牢な AI 評価の構築における技術的および運用上の困難を概説し、効果的な AI ガバナンスは、これらの測定の課題を克服することに依存すると主張しています。

405

Anthropic、Amazonによる40億ドルの投資とAWS Bedrock経由でのClaude 2アクセスの拡大を発表

Anthropicは、Amazonによる最大40億ドルの投資を受け、AWSをモデルの主要なクラウドとして指定し、Amazon Bedrock上でClaude 2の提供範囲を拡大することで、企業向けに、より安全で高性能なAIを提供します。

406

AnthropicのClaude向け100kトークンコンテキスト窓口用プロンプト工学ガイド

Anthropicは、参照引用文の抽出と複数の文脈内例の提供が、70~95kトークンのドキュメントにおけるClaudeの記憶力に劇的な向上をもたらすことを定量的に示した研究を公開した。

407

Anthropicの責任あるスケーリングポリシー

Anthropicは、AIモデルの能力と大規模なリスクが増加するにつれて、より厳格な安全対策とセキュリティプロトコルを義務付けるAI安全レベル(ASL)を用いた責任あるスケーリングポリシー(RSP)を導入しました。

408

AnthropicとBCGのエンタープライズAI展開に向けたパートナーシップ

Anthropicは、安全で責任ある生成AIソリューションの展開に焦点を当て、Claude AIを企業の戦略的サービスに統合するためにBoston Consulting Group (BCG) と提携しました。

409

Claude Pro リリースノート

Anthropicは、Claude.aiの有料サブスクリプションプランであるClaude Proを導入しました。月額20ドル(米国)または18ポンド(英国)で、Claude 2モデルの利用量が5倍になり、優先アクセスおよび新機能への早期アクセスが提供されます。

410

AnthropicとSK Telecomのパートナーシップ発表

AnthropicとSK Telecom (SKT) は、電気通信業界向けにカスタマイズされたLLMを開発するために、商業パートナーシップと戦略的投資を開始しました。

411

Claude Instant 1.2 リリースノート

Anthropic は、数学、コーディング、推論力、セキュリティの面で 1.1 バージョンを向上させた、より高速で低価格な Claude Instant 1.2 をリリースしました。

412

影響関数を用いた大規模言語モデルの汎化の研究

Anthropicの研究者は、EK-FAC近似を使用して影響関数を最大 52 billion パラメータを持つ LLM にスケールさせ、モデルの挙動を駆動する特定のトレーニング例を特定することを可能にしました。

413

Anthropic Research: Tracing Model Outputs to Training Data using Influence Functions

Anthropicの研究者たちは、影響関数を最大520億パラメータのLLMにスケールアップさせ、モデルの規模が大きくなるにつれて、モデルの汎化がより抽象的で概念的なものへと変化することを発見しました。

414

Anthropic Frontier Threats Red Teaming for AI Safety

Anthropicは、国家安全保障上のリスクを特定し、軽減するためのフロンティア脅威レッドチーミングのフレームワークを確立しました。具体的には、緩和策のないLLMが今後2〜3年以内に生物学的兵器化の取り組みを加速させる可能性があることを発見しました。

415

Anthropic Frontier Model Security Framework

Anthropicは、盗難や悪用を防ぐために、マルチパーティ・オーソリゼーションと安全なソフトウェア開発標準に基づいた、フロンティアAIモデルのためのセキュリティフレームワークを提案しています。

416

Anthropic、質問の分解がモデル生成の推論の忠実度を高めることを示す

Anthropicは、質問をサブ質問に分解することで、標準的なChain-of-Thoughtプロンプトと比較して、大規模言語モデルの推論の忠実度が著しく向上することを発表しました。

417

AnthropicによるChain-of-Thought(思考の連鎖)推論の忠実性に関する研究

Anthropicは、大規模な言語モデルが不忠実なChain-of-Thought(思考の連鎖)の説明を生成することが多いことを見出し、その忠実性はタスクやモデルのサイズによって大きく異なることを明らかにしました。

418

Claude 2 リリースノート

Anthropicは、100Kトークンのコンテキストウィンドウ、コーディングと推論におけるパフォーマンスの向上、およびClaude 1.3と比較した安全性の強化を特徴とするClaude 2をリリースしました。

419

Anthropic、LLMにおける主観的な世界的意見の表現を測定するためのGlobalOpinionQAフレームワークを発表

Anthropicは、大規模言語モデルがしばしば米国や特定の欧州の意見を反映していることを明らかにするデータセットおよび定量的なフレームワークであるGlobalOpinionQAをリリースしました。また、プロンプトや翻訳が、これらのバイアアスをシフトさせることはできても、完全に修正することはできないことも示しています。

420

NTIAに対するAnthropicのAIアカウンタビリティに関する推奨事項

Anthropicは、標準化された評価、リスクに応じた評価、および大規模なトレーニング・ランの事前登録に焦点を当て、AIアカウンタビリティのための包括的なフレームワークをNTIAに提案しました。

421

Anthropic Interpretability Dreams Research Vision

Anthropicは、大規模なニューラルネットワークの分析を可能にするために、重ね合わせの課題の解決に焦点を当てた、メカニズム的解釈可能性に関する長期的なビジョンを概説しています。

422

Anthropic Circuits Updates May 2023

Anthropicの2023年5月の解釈可能性に関するアップデートは、マルチエージェントシステムの失敗、労働者の再教育プログラムの証拠、および研究用バージョンのClaudeによるリーマンゼータ関数の進展に関する研究をカバーしています。

423

Anthropicが信頼性の高いAI製品を拡大するために4億5000万ドルのシリーズC資金調達を実施

Anthropicは、Claudeアシスタントの開発を加速し、製品ラインナップを拡大し、AI安全性研究に資金を提供するため、Spark Capitalが主導する4億5000万ドルのシリーズC資金調達を実施したと発表しました。

424

AnthropicとZoomのパートナーシップおよび投資

AnthropicとZoomは、Claude AIをZoomのエンタープライズ向けコラボレーション製品に統合するために提携し、Zoom VenturesはAnthropicに投資しました。

425

AnthropicがClaudeに100Kトークンのコンテキストウィンドウを発表

AnthropicはClaudeのコンテキストウィンドウを9Kから100Kトークンに拡大し、モデルが数百ページのテキストを1分未満で取り込み、分析することを可能にしました。

426

Claudeの憲法:モデルのアライメントのための憲法AIの実装

Anthropicは、暗黙的な人間によるフィードバックにのみ頼るのではなく、明示的な一連の書かれた原則に基づいて、Claudeを「有用、誠実、無害」にするためのトレーニング手法である憲法AIを導入しています。

427

Anthropic Research: Distributed Representations, Composition, and Superposition

Anthropicは、分散表現における組成と重ね合わせの区別を明確にし、これら2つのメカニズムがニューラルネットワークの汎化と線形計算可能性にどのように影響するかを説明しています。

428

AnthropicとScaleのエンタープライズ向け生成AIパートナーシップ

AnthropicはScaleと提携し、Claude AIアシスタントをScaleのプラットフォームに統合することで、企業にデプロイメントツール、プロンプトエンジニアリング、および安全なデータ統合を提供します。

429

AI測定のためのNISTへの資金提供増額に関するAnthropicの提案

Anthropicは、標準化されたAI測定ツールと安全性の閾値を開発するために、国立標準技術研究所(NIST)への資金提供を野心的に増額することを提案しています。これは、効果的なAI規制を実現するための前提条件であると彼らは主張しています。

430

AnthropicがTransformerの残差ストリームにおける特権的基底を明らかにする

Anthropicは、Transformerの残差ストリームの次元が任意ではなく、Adamの次元ごとの正規化子により特権的基底と一致していることを発見し、従来の理論的仮定に挑戦しています。

431

Claudeのご紹介

Anthropicは、役に立ち、誠実で、無害であることを目指して設計された次世代AIアシスタント、Claudeをリリースしました。高性能版と高速で軽量なバージョンの両方が利用可能です。

432

AnthropicのAI安全性に関する核心的な見解

Anthropicは、変革的なAIシステムの急速なスケーリングに伴う壊滅的なリスクを軽減するため、実証に基づいたポートフォリオ・アプローチによるAI安全性への取り組みを概説しています。

433

Anthropic Research: LLMにおける道徳的自己修正能力

Anthropicの研究は、RLHFで訓練された大規模言語モデル(LLM)が、指示を受けた際に有害な出力を回避するために道徳的に自己修正できることを示しており、この能力は22Bパラメータで発現します。

434

Anthropic が Google Cloud と AI インフラストラクチャに関する提携を発表

Anthropic は、GPU および TPU クラスタを活用して、AI システム(Claude アシスタントを含む)のトレーニング、スケーリング、デプロイを行うため、Google Cloud をクラウドプロバイダーとして選定しました。

435

Anthropic Research: Superposition, Memorization, and Double Descent

Anthropicの研究者たちは、単純なニューラルネットワークにおける重ね合わせ、記憶、および過学習の関係を調査しており、重ね合わせによってモデルが記憶中にニューロンの数よりも多くの特徴量を保存できることを示唆しています。

436

Anthropic Research: Discovering Language Model Behaviors with Model-Written Evaluations

Anthropicの研究者は、より大きなモデルにおける逆スケーリングや追従性を含む、新しい挙動を特定するために、言語モデルを使用して高品質な評価を自動生成する手法を開発しました。

437

Constitutional AI: Harmlessness from AI Feedback

Anthropicは、有害な出力を減らすために、人間のラベル付けの代わりに、一連のルール(憲法)とAIフィードバックを使用して、無害なAIアシスタントを訓練する方法であるConstitutional AIを導入しました。

438

大規模言語モデルにおけるスケーラブルな監視の進捗を測定する

Anthropicの研究者たちは、人間が最終的に複雑なタスクにおいて人間を凌駕する可能性があるAIシステムを監視できるようにするために、スケーラブルな監視を経験的に研究するためのフレームワークを提案しています。

439

Anthropic Toy Models of Superposition Research

Anthropicの研究者たちは、小さなReLUネットワークを使用して、特徴量が疎であれば、モデルはsuperpositionと呼ばれる現象を通じて、次元数よりも多くの特徴量を表現できることを実示しています。

440

Anthropic 言語モデルのレッドチーミング報告書 – 手法、スケーリング挙動、および得られた教訓

Anthropic は、人間のフィードバックによる強化学習(RLHF)モデルがスケールに応じてレッドチーミングが困難になる一方で、他のモデルタイプはレッドチーミングのしやすさが変化しないことを示す詳細な研究を公開しました。また、コミュニティの安全性向上を支援するために、38,961 件の攻撃データセットを公開しました。

441

Anthropic Research: Language Models (Mostly) Know What They Know

Anthropicの研究は、大規模言語モデルが自身の主張の妥当性を効果的に評価し、回答を知っている可能性を予測できることを示しており、より誠実なAIへの道筋を提供しています。

442

Anthropic Softmax Linear Units (SoLU) Research

Anthropicは、モデルのパフォーマンスを犠牲にすることなく、解釈可能なニューロンの割合を増やすMLP活性化関数のアーキテクチャ変更であるSoftmax Linear Units (SoLU) を導入しました。

443

Anthropic Research: Scaling Laws and Interpretability of Learning from Repeated Data

Anthropicの研究者は、トレーニングデータのわずかな一部を繰り返すことで、モデルの容量を記憶に費やし、induction heads のような汎化構造を損なうことにより、LLMの性能を深刻に低下させることができることを発見しました。

444

AIの安全性と研究のためのAnthropicシリーズB資金調達

Anthropicは、計算負荷の高いAIモデルの制御可能性、解釈可能性、および堅牢性を向上させることを目的とした大規模な実験用インフラストラクチャを構築するために、シリーズBで5億8000万ドルを調達しました。

445

Anthropic: RLHFを用いた有益で無害なアシスタントのトレーニング

Anthropicは、人間からのフィードバックによる強化学習(RLHF)が、アシスタントの有益性と無害性を確保しつつ、ほとんどのNLP評価において言語モデルのパフォーマンスを向上させることを示しています。

446

Anthropic In-context Learning and Induction Heads

Anthropicは2022年3月8日に「In-context Learning and Induction Heads」という研究投稿を公開しましたが、そのページには関連リンクのみが含まれており、実質的な技術的詳細は含まれていません。

447

Anthropic Research: Predictability and Surprise in Large Generative Models

Anthropicは、大規模生成モデルにおける損失の予測可能なスケーリングと、特定の能力や出力の予測不可能な創発との間の緊張関係を特定しており、これがAIの安全性と政策における課題を生来じています。

448

Anthropic、Transformer Circuitsの数学的フレームワークを発表

Anthropicは、Transformer Circuitsの新しい数学的フレームワークを発表しましたが、投稿には技術的な詳細は含まれておらず、モデルの挙動の理解を深める可能性を強調しています。

449

Anthropic Research: A General Language Assistant as a Laboratory for Alignment

Anthropicは、役に立ち、誠実で、無害な汎用言語アシスタントを作成する方法を探索しており、ランク付けされた好みのモデリングが、模倣学習や二値識別よりも効果的にスケールすることを発見しました。

450

信頼できる汎用AIシステムのためのAnthropicのシリーズA資金調達

Anthropicは、制御可能で、解釈可能で、かつ堅牢な大規模AIシステムの開発のために、シリーズAで1億2400万ドルを調達しました。