✷ アーカイブ · ラボ 11 拠点 · ディスパッチ 450 件
ラボ
毎朝十数個の公式ブログを開いて回る必要はありません。OpenAI、Anthropic、DeepMind などの一次発表を、要点を抜き出した形で。
集団的憲法AI:パブリックインプットによる言語モデルの調整
AnthropicとCollective Intelligence Projectは、約1,000人の米国市民による憲法を用いて言語モデルを調整する手法を開発しました。その結果、企業内部の憲法で調整されたモデルよりも、社会的バイアスが低いモデルが実現しました。
Anthropic Research: Decomposing Language Models With Dictionary Learning
Anthropicの研究者は、辞書学習を用いて言語モデルの層を単一の意味を持つ特徴量に分解する手法を開発しました。これにより、個々のニューロンレベルでは不可視であった複雑なニューラルネットワークの活性化を解釈することが可能になります。
Anthropic、言語モデルを分解して理解可能なコンポーネントに分解する
Anthropicの研究者たちは、辞書学習を用いてニューラルネットワークの活性化を解釈可能な特徴量に分解する手法を開発しました。これにより、解釈不可能な個々のニューロンの限界を超えようとしています。
Anthropic: AIシステムの評価における課題
Anthropic は、堅牢な AI 評価の構築における技術的および運用上の困難を概説し、効果的な AI ガバナンスは、これらの測定の課題を克服することに依存すると主張しています。
Anthropic、Amazonによる40億ドルの投資とAWS Bedrock経由でのClaude 2アクセスの拡大を発表
Anthropicは、Amazonによる最大40億ドルの投資を受け、AWSをモデルの主要なクラウドとして指定し、Amazon Bedrock上でClaude 2の提供範囲を拡大することで、企業向けに、より安全で高性能なAIを提供します。
AnthropicのClaude向け100kトークンコンテキスト窓口用プロンプト工学ガイド
Anthropicは、参照引用文の抽出と複数の文脈内例の提供が、70~95kトークンのドキュメントにおけるClaudeの記憶力に劇的な向上をもたらすことを定量的に示した研究を公開した。
Anthropicの責任あるスケーリングポリシー
Anthropicは、AIモデルの能力と大規模なリスクが増加するにつれて、より厳格な安全対策とセキュリティプロトコルを義務付けるAI安全レベル(ASL)を用いた責任あるスケーリングポリシー(RSP)を導入しました。
AnthropicとBCGのエンタープライズAI展開に向けたパートナーシップ
Anthropicは、安全で責任ある生成AIソリューションの展開に焦点を当て、Claude AIを企業の戦略的サービスに統合するためにBoston Consulting Group (BCG) と提携しました。
Claude Pro リリースノート
Anthropicは、Claude.aiの有料サブスクリプションプランであるClaude Proを導入しました。月額20ドル(米国)または18ポンド(英国)で、Claude 2モデルの利用量が5倍になり、優先アクセスおよび新機能への早期アクセスが提供されます。
AnthropicとSK Telecomのパートナーシップ発表
AnthropicとSK Telecom (SKT) は、電気通信業界向けにカスタマイズされたLLMを開発するために、商業パートナーシップと戦略的投資を開始しました。
Claude Instant 1.2 リリースノート
Anthropic は、数学、コーディング、推論力、セキュリティの面で 1.1 バージョンを向上させた、より高速で低価格な Claude Instant 1.2 をリリースしました。
影響関数を用いた大規模言語モデルの汎化の研究
Anthropicの研究者は、EK-FAC近似を使用して影響関数を最大 52 billion パラメータを持つ LLM にスケールさせ、モデルの挙動を駆動する特定のトレーニング例を特定することを可能にしました。
Anthropic Research: Tracing Model Outputs to Training Data using Influence Functions
Anthropicの研究者たちは、影響関数を最大520億パラメータのLLMにスケールアップさせ、モデルの規模が大きくなるにつれて、モデルの汎化がより抽象的で概念的なものへと変化することを発見しました。
Anthropic Frontier Threats Red Teaming for AI Safety
Anthropicは、国家安全保障上のリスクを特定し、軽減するためのフロンティア脅威レッドチーミングのフレームワークを確立しました。具体的には、緩和策のないLLMが今後2〜3年以内に生物学的兵器化の取り組みを加速させる可能性があることを発見しました。
Anthropic Frontier Model Security Framework
Anthropicは、盗難や悪用を防ぐために、マルチパーティ・オーソリゼーションと安全なソフトウェア開発標準に基づいた、フロンティアAIモデルのためのセキュリティフレームワークを提案しています。
Anthropic、質問の分解がモデル生成の推論の忠実度を高めることを示す
Anthropicは、質問をサブ質問に分解することで、標準的なChain-of-Thoughtプロンプトと比較して、大規模言語モデルの推論の忠実度が著しく向上することを発表しました。
AnthropicによるChain-of-Thought(思考の連鎖)推論の忠実性に関する研究
Anthropicは、大規模な言語モデルが不忠実なChain-of-Thought(思考の連鎖)の説明を生成することが多いことを見出し、その忠実性はタスクやモデルのサイズによって大きく異なることを明らかにしました。
Claude 2 リリースノート
Anthropicは、100Kトークンのコンテキストウィンドウ、コーディングと推論におけるパフォーマンスの向上、およびClaude 1.3と比較した安全性の強化を特徴とするClaude 2をリリースしました。
Anthropic、LLMにおける主観的な世界的意見の表現を測定するためのGlobalOpinionQAフレームワークを発表
Anthropicは、大規模言語モデルがしばしば米国や特定の欧州の意見を反映していることを明らかにするデータセットおよび定量的なフレームワークであるGlobalOpinionQAをリリースしました。また、プロンプトや翻訳が、これらのバイアアスをシフトさせることはできても、完全に修正することはできないことも示しています。
NTIAに対するAnthropicのAIアカウンタビリティに関する推奨事項
Anthropicは、標準化された評価、リスクに応じた評価、および大規模なトレーニング・ランの事前登録に焦点を当て、AIアカウンタビリティのための包括的なフレームワークをNTIAに提案しました。
Anthropic Interpretability Dreams Research Vision
Anthropicは、大規模なニューラルネットワークの分析を可能にするために、重ね合わせの課題の解決に焦点を当てた、メカニズム的解釈可能性に関する長期的なビジョンを概説しています。
Anthropic Circuits Updates May 2023
Anthropicの2023年5月の解釈可能性に関するアップデートは、マルチエージェントシステムの失敗、労働者の再教育プログラムの証拠、および研究用バージョンのClaudeによるリーマンゼータ関数の進展に関する研究をカバーしています。
Anthropicが信頼性の高いAI製品を拡大するために4億5000万ドルのシリーズC資金調達を実施
Anthropicは、Claudeアシスタントの開発を加速し、製品ラインナップを拡大し、AI安全性研究に資金を提供するため、Spark Capitalが主導する4億5000万ドルのシリーズC資金調達を実施したと発表しました。
AnthropicとZoomのパートナーシップおよび投資
AnthropicとZoomは、Claude AIをZoomのエンタープライズ向けコラボレーション製品に統合するために提携し、Zoom VenturesはAnthropicに投資しました。
AnthropicがClaudeに100Kトークンのコンテキストウィンドウを発表
AnthropicはClaudeのコンテキストウィンドウを9Kから100Kトークンに拡大し、モデルが数百ページのテキストを1分未満で取り込み、分析することを可能にしました。
Claudeの憲法:モデルのアライメントのための憲法AIの実装
Anthropicは、暗黙的な人間によるフィードバックにのみ頼るのではなく、明示的な一連の書かれた原則に基づいて、Claudeを「有用、誠実、無害」にするためのトレーニング手法である憲法AIを導入しています。
Anthropic Research: Distributed Representations, Composition, and Superposition
Anthropicは、分散表現における組成と重ね合わせの区別を明確にし、これら2つのメカニズムがニューラルネットワークの汎化と線形計算可能性にどのように影響するかを説明しています。
AnthropicとScaleのエンタープライズ向け生成AIパートナーシップ
AnthropicはScaleと提携し、Claude AIアシスタントをScaleのプラットフォームに統合することで、企業にデプロイメントツール、プロンプトエンジニアリング、および安全なデータ統合を提供します。
AI測定のためのNISTへの資金提供増額に関するAnthropicの提案
Anthropicは、標準化されたAI測定ツールと安全性の閾値を開発するために、国立標準技術研究所(NIST)への資金提供を野心的に増額することを提案しています。これは、効果的なAI規制を実現するための前提条件であると彼らは主張しています。
AnthropicがTransformerの残差ストリームにおける特権的基底を明らかにする
Anthropicは、Transformerの残差ストリームの次元が任意ではなく、Adamの次元ごとの正規化子により特権的基底と一致していることを発見し、従来の理論的仮定に挑戦しています。
Claudeのご紹介
Anthropicは、役に立ち、誠実で、無害であることを目指して設計された次世代AIアシスタント、Claudeをリリースしました。高性能版と高速で軽量なバージョンの両方が利用可能です。
AnthropicのAI安全性に関する核心的な見解
Anthropicは、変革的なAIシステムの急速なスケーリングに伴う壊滅的なリスクを軽減するため、実証に基づいたポートフォリオ・アプローチによるAI安全性への取り組みを概説しています。
Anthropic Research: LLMにおける道徳的自己修正能力
Anthropicの研究は、RLHFで訓練された大規模言語モデル(LLM)が、指示を受けた際に有害な出力を回避するために道徳的に自己修正できることを示しており、この能力は22Bパラメータで発現します。
Anthropic が Google Cloud と AI インフラストラクチャに関する提携を発表
Anthropic は、GPU および TPU クラスタを活用して、AI システム(Claude アシスタントを含む)のトレーニング、スケーリング、デプロイを行うため、Google Cloud をクラウドプロバイダーとして選定しました。
Anthropic Research: Superposition, Memorization, and Double Descent
Anthropicの研究者たちは、単純なニューラルネットワークにおける重ね合わせ、記憶、および過学習の関係を調査しており、重ね合わせによってモデルが記憶中にニューロンの数よりも多くの特徴量を保存できることを示唆しています。
Anthropic Research: Discovering Language Model Behaviors with Model-Written Evaluations
Anthropicの研究者は、より大きなモデルにおける逆スケーリングや追従性を含む、新しい挙動を特定するために、言語モデルを使用して高品質な評価を自動生成する手法を開発しました。
Constitutional AI: Harmlessness from AI Feedback
Anthropicは、有害な出力を減らすために、人間のラベル付けの代わりに、一連のルール(憲法)とAIフィードバックを使用して、無害なAIアシスタントを訓練する方法であるConstitutional AIを導入しました。
大規模言語モデルにおけるスケーラブルな監視の進捗を測定する
Anthropicの研究者たちは、人間が最終的に複雑なタスクにおいて人間を凌駕する可能性があるAIシステムを監視できるようにするために、スケーラブルな監視を経験的に研究するためのフレームワークを提案しています。
Anthropic Toy Models of Superposition Research
Anthropicの研究者たちは、小さなReLUネットワークを使用して、特徴量が疎であれば、モデルはsuperpositionと呼ばれる現象を通じて、次元数よりも多くの特徴量を表現できることを実示しています。
Anthropic 言語モデルのレッドチーミング報告書 – 手法、スケーリング挙動、および得られた教訓
Anthropic は、人間のフィードバックによる強化学習(RLHF)モデルがスケールに応じてレッドチーミングが困難になる一方で、他のモデルタイプはレッドチーミングのしやすさが変化しないことを示す詳細な研究を公開しました。また、コミュニティの安全性向上を支援するために、38,961 件の攻撃データセットを公開しました。
Anthropic Research: Language Models (Mostly) Know What They Know
Anthropicの研究は、大規模言語モデルが自身の主張の妥当性を効果的に評価し、回答を知っている可能性を予測できることを示しており、より誠実なAIへの道筋を提供しています。
Anthropic Softmax Linear Units (SoLU) Research
Anthropicは、モデルのパフォーマンスを犠牲にすることなく、解釈可能なニューロンの割合を増やすMLP活性化関数のアーキテクチャ変更であるSoftmax Linear Units (SoLU) を導入しました。
Anthropic Research: Scaling Laws and Interpretability of Learning from Repeated Data
Anthropicの研究者は、トレーニングデータのわずかな一部を繰り返すことで、モデルの容量を記憶に費やし、induction heads のような汎化構造を損なうことにより、LLMの性能を深刻に低下させることができることを発見しました。
AIの安全性と研究のためのAnthropicシリーズB資金調達
Anthropicは、計算負荷の高いAIモデルの制御可能性、解釈可能性、および堅牢性を向上させることを目的とした大規模な実験用インフラストラクチャを構築するために、シリーズBで5億8000万ドルを調達しました。
Anthropic: RLHFを用いた有益で無害なアシスタントのトレーニング
Anthropicは、人間からのフィードバックによる強化学習(RLHF)が、アシスタントの有益性と無害性を確保しつつ、ほとんどのNLP評価において言語モデルのパフォーマンスを向上させることを示しています。
Anthropic In-context Learning and Induction Heads
Anthropicは2022年3月8日に「In-context Learning and Induction Heads」という研究投稿を公開しましたが、そのページには関連リンクのみが含まれており、実質的な技術的詳細は含まれていません。
Anthropic Research: Predictability and Surprise in Large Generative Models
Anthropicは、大規模生成モデルにおける損失の予測可能なスケーリングと、特定の能力や出力の予測不可能な創発との間の緊張関係を特定しており、これがAIの安全性と政策における課題を生来じています。
Anthropic、Transformer Circuitsの数学的フレームワークを発表
Anthropicは、Transformer Circuitsの新しい数学的フレームワークを発表しましたが、投稿には技術的な詳細は含まれておらず、モデルの挙動の理解を深める可能性を強調しています。
Anthropic Research: A General Language Assistant as a Laboratory for Alignment
Anthropicは、役に立ち、誠実で、無害な汎用言語アシスタントを作成する方法を探索しており、ランク付けされた好みのモデリングが、模倣学習や二値識別よりも効果的にスケールすることを発見しました。
信頼できる汎用AIシステムのためのAnthropicのシリーズA資金調達
Anthropicは、制御可能で、解釈可能で、かつ堅牢な大規模AIシステムの開発のために、シリーズAで1億2400万ドルを調達しました。