sparrow: 構造化データ抽出とエージェント型ワークフローのためのAPIファーストなドキュメントインテリジェンスプラットフォーム
Vision LLMsとエージェント型ワークフローを使用して、請求書、領収書、および明細書を構造化されたJSONに変換する、エンタープライズ向けドキュメントインテリジェンスのためのAPIファーストなプラットフォーム。
Chinese-CLIP: クロスモーダル検索とゼロショット画像分類のための大規模中国語ビジョン・ランゲージ・モデル
2億組の画像・テキストペアで学習された、クロスモーダル検索とゼロショット画像分類のためのCLIPモデルの中国語版。
scikit-image: 科学的な画像処理および解析のための包括的なPythonライブラリ
scikit-imageは、画像の解析および操作のためのアルゴリズムのコレクションを提供する、画像処理用のPythonライブラリです。
Final2x: カスタムモデルとNvidia 50シリーズGPUをサポートするクロスプラットフォーム画像超解像ツール
AIモデルを使用して画像をアップスケールし、解像度を向上させるクロスプラットフォーム画像超解像ツール。
gocv: OpenCV 4 コンピュータビジョンライブラリ用の Go 言語バインディング
GoCV は OpenCV 4 の Go 言語バインディングを提供し、Go 開発者が高度なコンピュータビジョンとハードウェアアクセラレーションによる画像処理をアプリケーションに統合できるようにします。
librealsense: RealSenseカメラから深度およびカラーデータをストリーミングするためのクロスプラットフォームライブラリ
RealSense深度カメラ用のクロスプラットフォームSDKであり、深度およびカラーのストリーミングを可能にし、コンピュータビジョンやロボティクス用のキャリブレーションデータを提供します。
rerun: 物理AIおよびロボティクス向けのマルチモーダル・データレイヤーおよびビジュアル・デバッガー
物理AIのためのマルチモーダル・データレイヤーおよびビジュアル・デバッガー。開発者がマルチレートのセンサー・データをリアルタイムでログに記録、クエリ、および可視化することを可能にします。
pcl: 0
2D/3D画像とポイントクラウド処理のための大規模オープンソースライブラリ。ロボティクスや3D認識への活用が広く lte_id: 0
segmentation_models.pytorch: 800以上の学習済みエンコーダーを備えた画像セマンティックセグメンテーション用のハイレベルPyTorchライブラリ
幅広い学習済みエンコーダーとアーキテクチャを使用して、画像セマンティックセグメンテーション・モデルを簡単に作成・トレーニングできるハイレベルAPIを提供するPyTorchライブラリ。
LinuxMD が Linux を Sega MegaDrive(Genesis)に導入
LinuxMD は EverDrive カートリッジを使用して Sega MegaDrive 上でフル Linux カーネルを起動できることを実証し、68000 ベースのコンソールで Unix が実現可能であることを示しています。
Meshroom: 3D再構成およびコンピュータビジョン・パイプラインのためのノードベースのビジュアルプロジュアルプログラミング・フレームワーク
3D再構成およびコンピュータビジョン用のノードベースのビジュアルプログラミング・フレームワーク。AIとフォトグラメトリを使用して、ユーザーが複雑なデータ処理パイプラインを構築することを可能にします。
open_clip: 大規模な対照学習型言語・画像および音声・テキストモデルのトレーニングとデプロイのためのオープンソースフレームワーク
OpenAIのCLIPのオープンソース実装であり、ゼロショット分類や検索のために大規模な対照学習型言語・画像モデルのトレーニングと使用を可能にします。
carla: 自動運転システムのトレーニングと検証のためのオープンソースの都市走行シミュレータ
自動運転研究のためのオープンソースのシミュレータ。シミュレートされた都市環境において、自動運転システムの開発、トレーニング、および検証に使用されます。
labelme: AI支援マスキングとマルチフォーマット・データセット・エクスポート機能を備えたグラフィカルな画像アノテーションツール
さまざまな形状やAI支援ツールを使用して画像をラベル付けし、コンピュータビジョン・モデル用のデータセットを作成できる、グラフィカルな画像アノテーションツール。
cvat: 高品質なコンピュータビジョン用データセット構築のためのプロフェッショナルなデータアノテーションプラットフォーム
コンピュータビジョン向けの高品質な視覚的データセットを構築するためのオープンソースのデータアノテーションプラットフォーム。画像、ビデオ、および3Dアノテーションをサポート。
AirSim: 自律走行車両およびAI研究のための高忠実度な視覚・物理シミュレータ
Unreal Engine上に構築されたドローンおよび車両用のオープンソースシミュレータであり、ディープラーニング、コンピュータビジョン、および強化学習におけるAI研究のためのプラットフォームとして設計されています。
MaaAssistantArknights: Arknightsの日常タスクと基地管理を自動化する画像認識ベースの自動化アシスタント
画像認識とディープラーニングを使用して、Arknightsの日常タスク、基地管理、およびリソース稼ぎを自動化するArknights用自動化アシスタント。
vit-pytorch: PyTorchで実装されたVision Transformer (ViT) とその派生モデルの包括的なコレクション
オリジナルのVision Transformer (ViT) と、画像分類のための数十種類の高度な派生モデルを実装した包括的なPyTorchライブラリ。
label-studio: マルチモーダルなオープンソースデータラベリングツール(ML支援の事前ラベリングとアクティブラーニング付き)
オープンソースのデータラベリングツールで、音声、テキスト、画像、動画にアノテーションを付け、機械学習モデルの学習データを作成または改善できます。
espnet: ASR、TTS、および話し言葉の理解のための包括的なエンドツーエンド音声処理ツールキット
PyTorchを使用して、ASR、TTS、音声翻訳、および音声強調のための統一されたフレームワークを提供するエンドツーエンドの音声処理ツールキット。
leon: エージェント実行機能とローカルファーストのプライバシーを備えたオープンソースのパーソナルAIアシスタント
ツール、メモリ、およびエージェント実行機能を使用してタスクを実行し、プライバシーのためにローカルAIモデルをサポートするオープンソースのパーソナルAIアシスタント。
Cursor iOS アプリがユーザーを同意なしに新しいプライバシーモードへ切り替える
Cursor iOS アプリをインストールすると、レガシーの「コードを保存しない」プライバシーモードから、より制限の緩い新しいモードへ自動的に移行し、レガシーオプションはアプリ内で復元できません。
PlayStation Store スタジオ・カナル映画の削除
ソニーは、PlayStation Store のユーザーアカウントから数百本のスタジオ・カナル映画を返金なしで削除し、デジタル所有権の本質を巡る議論を呼び起こしました。
米国最高裁判所、ジオフェンス令状は憲法上の保護が必要と判断
米国最高裁判所は、ジオフェンス令状は第四修正条項の保護に従わなければならないと判断し、位置情報サービスへのオプトインがユーザーのプライバシー権を放棄するという主張を退けました。
Tidal AI ポリシー:AI 生成音楽の収益化停止
Tidal は、プラットフォーム上で AI 生成音楽の掲載は許可するものの、収益化を禁止する新しい AI ポリシーを導入し、ロイヤリティが人間アーティストに確保されるようにしました。
HunyuanVideo-1.5: コンシューマー向けGPUで高品質な合成を実現する軽量8.3Bパラメータ動画生成モデル
コンシューマー向けGPUで高品質なtext-to-videoおよびimage-to-videoの合成を可能にする、軽量な8.3Bパラメータの動画生成モデル。
OpenMontage: リサーチ、スクリプト作成、編集を統合してフルプロダクションパイプラインを実現するエージェント型ビデオ制作システム
リサーチ、スクリプト作成、アセット生成、および編集をオーケストレーションして、自然言語のプロンプトからプロフェッショナルなビデオを制作する、オープンソースのエージェント型ビデオ制作システム。
Ornith-1.0 リリース: エージェンティック・コーディングのための自己改善型オープンソースモデル
Ornith-1.0は、Gemma 4およびQwen 3.5上でポストトレーニングされており、エージェンティック・コーディングとツール呼び出しに最適化された、MITライセンスの自己改善型オープンソースモデル(9Bから397B)のファミリーです。
Outer Shell: SSH 用のネイティブ グラフィカルシェル
Outer Shell は SSH を介してリモートサーバーにブラウザベースのグラフィカルインターフェースを提供し、Unix ドメインソケットを使用してネイティブおよび HTML ベースのアプリを公開します。公開 HTTP ポートは不要です。
Rocket LabがIridiumを取得
Rocket LabはIridiumを取得し、収益性の高い衛星通信ネットワークと貴重なスペクトラムを統合して、垂直統合型宇宙企業を構築しました。
サムスン、SK Hynix、Micronが米国でメモリ価格操作で訴えられる
サムスン、SK Hynix、Micronは、DRAM供給の削減と古いメモリ規格の廃止を協調し、価格を吊り上げたとする米国の訴訟に直面しています。
ZLUDA 6 リリース: 非NVIDIA GPU上で修正なしのCUDAアプリケーションを実行する
ZLUDA 6は、32ビットPhysXのサポート、Blender用の基本的なテクスチャ・サポート、および非NVIDIAハードウェア上でCUDAアプリケーションを実行するためのWindowsの使いやすさの大幅な向上を導入します。
Mullvad VPN論争:共同創業者Daniel Berntssonの政治的寄付
Mullvad VPNの共同創業者Daniel BerntssonによるスウェーデンのÖrebro党への資金提供が、企業の中立性と私的な政治的寄付および企業価値の交差点についての議論を引き起こしている。
AIとの付き合い方: 「魔法使いの弟子」問題の具体的な事例
Carson Grossは、hyperscript parserにおける実際のバグ修正を通じて、AIのソフトウェア開発における強みと弱みを探索し、AIが提案する解決策を盲目的に受け入れることの危険性を強調しています。
BAIR 2026 卒業生ショーケース
バークレー人工知能研究所(BAIR)は、2026年度の博士課程修了生クラスを発表し、ロボティクス、大規模言語モデル、AI安全、およびヘルスケアにおける研究を強調しました。
genai-processors: 非同期かつ構成可能なマルチモーダルAIパイプラインを構築するためのモジュール式フレームワーク
マルチモーダルコンテンツの処理とストリーミングを統一する、モジュール式、非同期、かつ構成可能なAIパイプラインを構築するための軽量なPythonライブラリ。
instill-core: データ処理、パイプライン・オーケストレーション、およびモデルホスティングのためのエンドツーエンドAIインフラストラクチャプラットフォーム
非構造化データ、AIパイプライン、およびモデルデプロイのオーケストレーションを簡素化し、RAGやAIファーストなアプリケーションを構築するためのエンドツーエンドAIプラットフォーム。
YTPro: AIによる動画要約と高度な再生コントロール機能を備えたカスタマイズ版YouTubeクライアント
Google Geminiを統合してAI動画要約を実現し、広告ブロックやコンテンツダウンロードツールを備えたカスタマイズ版YouTubeクライアント。
alan-sdk-web: ビジネスロジックとUIのリアルタイム生成を可能にするインテリジェントなアプリプラットフォームSDK
Webアプリケーションにインテリジェントなレイヤーを組み込み、ビジネスロジックとUIコンポーネントのリアルタイム生成を可能にするSDK。
presentation-ai: ローカルLLMとカスタムテーマをサポートするオープンソースのAIプレゼンテーションジェネレーター
アウトライン優先のワークフローを通じて、トピックからカスタマイズ可能なスライドを作成する、オープンソースのAI搭載プレゼンテーションジェネレーター。
TTS-WebUI: 数十種類のオープンソースのテキスト読み上げおよび音声生成モデルを実行・管理するための統合ウェブインターフェース
幅広いオープンソースのテキスト読み上げ、音声生成、および音声変換AIモデルを管理・実行するための統合ウェブインターフェース。
Gemini-API: Google Gemini ウェブアプリ用のリバースエンジニアリングされた非同期 Python ラッパー
Google Gemini ウェブアプリ用のリバースエンジニアリングされた非同期 Python ラッパー。画像生成、ディープリサーチ、カスタム Gems などの機能へのプログラム的なアクセスを可能にします。
hallucination-leaderboard: 要約タスクにおけるLLMのハルシネーション率を追跡する公開リーダーボード
VectaraのHallucination Evaluation Model (HHEM)を使用して、異なるLLMがドキュメントを要約する際にどの程度ハルシネーションを起こすかを測定・比較する公開リーダーボード。
semantic-router: semantic vector space を使用してルーティングを行う LLM およびエージェント向けの超高速な意思決定レイヤー
意味に基づいたルーティングを行うために、低速な LLM 生成ではなく semantic vector space を使用する、LLM およびエージェント向けの高速な意思決定レイヤー。
transformer-explainer: GPT-2の内部動作を学習するためのインタラクティブなブラウザベースの可視化ツール
ブラウザ上でライブのGPT-2モデルを実行し、Transformerベースのモデルがどのようにテキストを予測するかをユーザーが学習するのを助けるインタラクティブな可視化ツール。
ChatGPT-Shortcut: 複数のプラットフォームにわたるAI出力を向上させるための、厳選されたプロンプトライブラリおよび管理ツール
5,000以上のプロンプトを提供する厳選されたライブラリと、さまざまなAIプラットフォームにわたってカスタムプロンプトを整理、作成、共有するためのツールを備えたAIプロンプト管理ツール。
morphic: ストリームされたJSONからリッチなインラインコンポーネントをレンダリングする生成UIを備えたAI検索エンジン
生成UIを使用して、プレーンテキストの代わりにリッチで引用付きの回答をインタラクティブなコンポーネントと共にレンダリングするAI搭載の検索エンジン。
krita-ai-diffusion: Krita 用の生成 AI プラグイン。拡散モデルを統合して、精密な画像編集とペインティングを実現します
生成 AI 拡散モデルを Krita のペインティングワークフローに統合し、インペインティング、ライブペインティング、および精密な構造制御のためのツールを提供する Krita プラグイン。
outlines: 型制約付き生成による構造化されたLLM出力を保証するライブラリ
生成を特定のPythonの型またはPydanticモデルに一致させるように制約することで、LLMからの構造化された出力を保証するライブラリ。
Open-Generative-AI: ローカル推論とマルチモデル対応を備えた、制限のないAIビデオプラットフォームのオープンソース代替案
200以上のモデルを使用し、ローカル推論オプションとビジュアルワークフロービルダーを備えた、画像およびビデオ生成のためのオープンソースで制限のないAIスタジオ。