✷ アーカイブ · ラボ 11 拠点 · ディスパッチ 3,061 件
ラボ
毎朝十数個の公式ブログを開いて回る必要はありません。OpenAI、Anthropic、DeepMind などの一次発表を、要点を抜き出した形で。
Hugging Face AI Research Residency Program Announcement
Hugging Faceは、Hugging Face Science Teamと共に機械学習技術を開発し、オープンソースの成果を公開するための、研究者を志す人々のための9ヶ月間のAI Research Residency Programを開始しました。
カスタムデータセットを使用したセマンティックセグメンテーションのためのSegFormerのファインチューニング
Hugging Faceは、Transformersライブラリを使用してSegFormerモデルをファインチューニングし、自動歩道ナビゲーションのようなカスタムユースケースのためにピクセルレベルの画像分類を行うための技術ガイドを提供しています。
Hugging Face datasets による画像検索
Hugging Face は、`datasets` ライブラリ、CLIP 埋め込み、および FAISS を組み合わせて、効率的な類似性検索のための画像検索アプリケーションを構築する方法を実演しています。
Hugging Face Transformers と AWS Inferentia を使用して BERT 推論を加速させる
Hugging Face は、AWS Inferentia と Neuron SDK を使用して BERT 推論を加速させるガイドを提供しており、Amazon SageMaker 上で 5-6ms のレイテンシを実現しています。
GPT-3とCodexの編集および挿入機能
OpenAIは、単純なテキスト補完を超えて、既存のテキストを編集したり、ドキュメントの中間にコンテンツを挿入したりできる、GPT-3とCodexの新しいバージョンをリリースしました。
Hugging Face Transformersにおける制約付きビームサーチによるテキスト生成の誘導
Hugging Faceは、言語的な一貫性を維持しながら、生成されたテキストに特定の単語やフレーズを強制的に含めることができる制約付きビームサーチをTransformersライブラリに導入しました。
Anthropic In-context Learning and Induction Heads
Anthropicは2022年3月8日に「In-context Learning and Induction Heads」という研究投稿を公開しましたが、そのページには関連リンクのみが含まれており、実質的な技術的詳細は含まれていません。
OpenAI 経済影響研究イニシアチブ
OpenAI は、GPT‑3、ChatGPT、DALL‑E 2 などの大規模言語モデルの経済的影響を研究するため、研究者と企業からの関心表明を募集しています。
OpenAI コード生成モデルの経済的影響に関する研究アジェンダ
OpenAIは、展開、システム設計、および公共政策に情報を提供するために、Codexのようなコード生成モデルが生産性、雇用、および経済的不平等にどのように影響するかを研究する研究アジェンダを提案しました。
OpenAI 言語モデルの安全性と悪用に関する教訓
OpenAIは、GPT-3およびCodexのデプロイメントから得られた洞察を共有しており、現実世界の悪用は理論的なリスクとは異なる場合が多いこと、そして安全性研究が商業的有用性を高めることが多いという点を強調しています。
BERT 101: トランスフォーマーからの双方向エンコーダ表現の理解
BERTはGoogle AI Languageが開発した双方向トランスフォーマーベースのモデルで、膨大なデータセットでの教師なし事前学習を活用し、11以上の一般的なNLPタスクで最先端の性能を達成します。
Anthropic Research: Predictability and Surprise in Large Generative Models
Anthropicは、大規模生成モデルにおける損失の予測可能なスケーリングと、特定の能力や出力の予測不可能な創発との間の緊張関係を特定しており、これがAIの安全性と政策における課題を生来じています。
Hugging Face Transformersを使用した画像分類のためのVision Transformer (ViT) のファインチューニング
Hugging Faceは、datasetsおよびtransformersライブラリを使用して、画像分類のためのVision Transformer (ViT) モデルをファインチューニングするためのガイドを提供しており、beansデータセットを使用してそのプロセスを実演しています。
OpenAI Formal Math Olympiad Problem Solving
OpenAIは、形式的な証明アシスタントを使用して、AMC12、AIME、およびIMOといった競技会の形式的な数学オリンピック問題を解くモデルの能力を実証しました。
Pythonを使用した感情分析の始め方
Hugging Faceは、Hugging Face Hubからの学習済みモデル、微調整のためのTrainer API、およびノーコードのAutoNLPツールを活用して、Pythonを使用した感情分析を実装するための包括的なガイドを提供しています。
TransformersにおけるWav2Vec2を使用した大容量ファイル向け自動音声認識
Hugging Faceは、Wav2Vec2のConnectionist Temporal Classification (CTC) アーキテクチャを活用したストライディング技術を実装し、任意の長さの音声ファイルやライブ推論における高品質なASRを可能にします。
OpenAI InstructGPT: 言語モデルを指示に従うように調整する
OpenAIは、GPT-3と比較して、ユーザーの意図をより良く理解し、真実性を高め、有害性を低減するために、人間からのフィードバックによる強化学習(RLHF)を用いて訓練された一連のモデル、InstructGPTを導入しました。
OpenAI Text and Code Embeddings Release
OpenAIは、GPT-3の派生モデルに基づいた新しい埋め込みモデルのセットをリリースしました。これらは、テキストとコードの数値表現を提供し、意味的な検索、クラスタリング、およびコードの検索を向上させます。
Hugging Face Hub Search API Updates
Hugging Faceは、ModelSearchArgumentsやModelFilterを含む、huggingface_hubライブラリへの新しいプログラムによる検索機能を紹介しました。これにより、ユーザーがIDEを離れることなく、モデルやデータセットを簡単に見つけられるようになります。
対照学習による事前学習によるOpenAIのテキストおよびコードのEmbeddings
OpenAIは、大規模な教師なしデータに対する対照学習による事前学習を用いて、高品質なテキストおよびコードのembeddingsが生成される手法を開発しました。これにより、線形プローブ分類やセマンティック検索において最先端の結果を達成しています。
Stable-Baselines3 と Hugging Face Hub の統合
Hugging Face は Stable-Baselines3 を統合し、ユーザーが PyTorch Deep Reinforcement Learning モデルを Hugging Face Hub から直接ホスト、共有、およびロードできるようにしました。
Hugging Face Infinity CPU パフォーマンス ケーススタディ
Hugging Face Infinity は、Intel Ice Lake Xeon CPU において vanilla Transformers と比較して最大 800% 高いスループットとミリ秒単位のレイテンシを実現し、CPU インフラストラクチャ上でのコスト効率の高いリアルタイム Transformer デプロイメントを可能にします。
Hugging Face Transformersにおけるn-gramによるWav2Vec2の強化
Hugging Faceは、pyctcdecodeライブラリをTransformersライブラリに統合し、Wav2Vec2モデルをn-gram言語モデルで強化することで、スペルミスと単語誤り率(WER)を大幅に減少させることが可能になりました。
Amazon SageMaker で Hugging Face Transformers を使用して GPT-J 6B をデプロイする
Hugging Face は、torch.save を使用して EleutherAI の GPT-J 6B モデルを Amazon SageMaker にデプロイする方法を提供しており、モデルのロード時間を 3 分以上から 8 秒未満に短縮できます。
AutoNLPとProdigyによるアクティブラーニング
Hugging Faceは、AutoNLP自動トレーニングフレームワークとProdigyアノテーションツールを組み合わせることで、命名エンティティ認識(NER)のためのアクティブラーニング・パイプラインを構築する方法を実証しています。
Anthropic、Transformer Circuitsの数学的フレームワークを発表
Anthropicは、Transformer Circuitsの新しい数学的フレームワークを発表しましたが、投稿には技術的な詳細は含まれておらず、モデルの挙動の理解を深める可能性を強調しています。
Hugging Face が Gradio を買収
Hugging Face は、機械学習のデモと GUI を簡単に構築できるように統合し、エコシステムに組み込むことで、非技術者にも ML のアクセシビリティを拡張するために Gradio を買収しました。
WebGPT: WebブラウジングによるGPT-3の事実正確性の向上
OpenAIは、GPT-3をWebGPTへとファインチューニングしました。これは、テキストベースのWebブラウザを使用して情報を調査し、出典を引用することで、オープンエンドな質問への回答におけるハルシネーションを低減するプロトタイプです。
Perceiver IO: あらゆるモダリティに対応するスケーラブルで完全アテンション型のモデル
Perceiver IOは、潜在空間を使用することで計算量を入力サイズから切り離し、テキスト、画像、音声、ビデオ、ポイントクラウドを二次的なスケーリング問題なしに処理することを可能にするTransformerベースのアーキテクチャです。
アプリケーション向けにGPT-3をカスタマイズする
OpenAIはGPT-3のファインチューニング機能を提供開始し、開発者が独自のデータを使用してモデルをトレーニングすることで、信頼性の向上、コスト削減、およびレイテンシの改善を実現できるようにしました。
CodeParrotをスクラッチからトレーニングする
Hugging Faceは、Pythonコードのオートコンプリート機能を可能にするため、2,000万個のPythonファイルのクリーニング済みデータセットでスクラッチからトレーニングされたGPT-2ベースのモデル、CodeParrotを導入しました。
Hugging Face Snowball Fight ML-Agents環境
Hugging Faceは、Unity ML-Agentsで構築され、Hugging Face Spacesでホストされている最初のカスタムDeep Reinforcement Learning環境であるSnowball Fight 1vs1をリリースしました。
Anthropic Research: A General Language Assistant as a Laboratory for Alignment
Anthropicは、役に立ち、誠実で、無害な汎用言語アシスタントを作成する方法を探索しており、ランク付けされた好みのモデリングが、模倣学習や二値識別よりも効果的にスケールすることを発見しました。
OpenAI Residency Program Announcement
OpenAIは、他の分野の研究者やエンジニアを同社のフルタイムのAI職務へと移行させるために設計された、6ヶ月間の有償プログラム「OpenAI Residency」を開始しました。
Graphcore IPU統合のためのHugging Face Optimum
Hugging Faceは、最適化されたBERTの実装から始まり、Transformerモデルを加速させるためにOptimumライブラリをGraphcore Intelligence Processing Units (IPUs)と統合しました。
Hugging Face データ測定ツール
Hugging Faceは、オープンソースのPythonライブラリおよびノーコードインターフェースであるData Measurements Toolをリリースしました。これにより、開発者はより責任あるAI開発のためにMLデータセットを分析、キュレート、比較することができます。
Intel Technologies による PyTorch 分散ファインチューニングの加速
Hugging Face は、Intel extension for PyTorch と oneCCL を使用して、Intel Xeon Scalable CPU サーバーのクラスターにファインチューニング・ジョブを分散させることで、PyTorch トレーニングを加速する方法を実証しています。
OpenAI API アクセス: GPT-3 ウェイトリスト 削除
OpenAI は、サポートされている国の開発者がすぐにサインアップして実験を開始できるように、GPT-3 API のウェイトリストを削除しました。
低リソース音声認識のためのXLS-Rファインチューニング
Hugging Faceは、Transformersライブラリを使用して低リソース音声認識(ASR)のためのクロスリンガル音声表現モデルXLS-Rのファインチューニングに関する技術ガイドを提供します。
モダンなCPUにおけるBERTライクなモデルの推論のスケーリング - パート2
Hugging Faceは、Intel Ice Lake Xeon CPU上でのBERTライクなモデルのソフトウェアレベルの最適化を調査し、メモリ割り当て器、並列化ライブラリ、およびベイズ最適化を使用することで、推論レイテンシを大幅に削減できることを示しました。
OpenAIによる算数の文章題の解決とGSM8Kデータセット
OpenAIは、トレーニング済みの検証器を使用して、微調整されたGPT-3のほぼ2倍の精度で小学校レベルの算数の文章題を解決するシステムを開発しました。9〜12歳の子どもの60%の精度と比較して、55%の精度を達成しました。
Hugging Face コース Part 2 とコミュニティイベントの開始
Hugging Face は 2021 年 11 月 15 日に Hugging Face コースの Part 2 をリリースし、技術的な講演と実践的なプロジェクトを特徴とするコミュニティイベントを開催しました。
大規模言語モデル:新たなムーアの法則か?
Hugging Faceは、530BパラメータのMegatron-Turing NLGのようなモデルサイズの指数関数的な増大傾向を批判し、蒸留やファインチューニングのような実用的で効率的な代替案を推奨しています。
10億のトレーニングペアを用いたHugging Face Sentence Embedding Models
Hugging Faceは、JAX/FlaxおよびTPUインフラストラクチャを使用して、最大10億の文ペアを用いてトレーニングを行うことで、最先端の汎用文埋め込み(sentence embedding)モデルを開発しました。
Hugging Face: Machine Learning as Code の時代
Hugging Face は、MLOps を採用し、汎用的な Transformer アーキテクチャを活用し、サンドボックスでの実験よりもプロダクションへのデプロイを優先することで、機械学習をソフトウェアエンジニアリングの規律として扱うことを提唱しています。
CLIPのファインチューニング: リモートセンシングおよび衛星画像向け
研究チームは、RSICDデータセットおよびその他の衛星画像を使用してOpenAIのCLIPモデルをファインチューニングし、リモートセンシングアプリケーションにおけるテキストから画像への検索を大幅に向上させた。
Hugging Face Spaces と Gradio の統合
Hugging Face は Gradio を Spaces に統合し、ユーザーが Inference API またはカスタムモデルチェックポイントを使用して、機械学習モデルのデモを簡単にホストして公開できるようにしました。
Streamlitを使用したHugging Face Spacesでのモデルとデータセットのホスティング
Hugging Face SpacesはStreamlitと統合されており、ユーザーが機械学習モデルやデータの可視化のためのインタラクティブなデモを迅速に構築し、ホストすることを可能にします。
Hugging Face Summer 2021 Update
Hugging Faceは、MLデモホスティングのためのSpaces Beta、TensorBoard統合、およびハードウェアアクセラレーション用のOptimumライブラリのローンチを含む一連のHub拡張を発表しました。
OpenAI 人間のフィードバックを使った書籍の要約 (2021)
OpenAIは、人間のフィードバックからの強化学習と再帰的タスク分解を組み合わせた技術を導入し、評価が難しいタスクにおけるAIの監督というアライメントの課題に対処しながら、書籍全体の要約を生成しました。