2051

sparrow: 構造化データ抽出とエージェント型ワークフローのためのAPIファーストなドキュメントインテリジェンスプラットフォーム

Vision LLMsとエージェント型ワークフローを使用して、請求書、領収書、および明細書を構造化されたJSONに変換する、エンタープライズ向けドキュメントインテリジェンスのためのAPIファーストなプラットフォーム。

2052

Chinese-CLIP: クロスモーダル検索とゼロショット画像分類のための大規模中国語ビジョン・ランゲージ・モデル

2億組の画像・テキストペアで学習された、クロスモーダル検索とゼロショット画像分類のためのCLIPモデルの中国語版。

2053

scikit-image: 科学的な画像処理および解析のための包括的なPythonライブラリ

scikit-imageは、画像の解析および操作のためのアルゴリズムのコレクションを提供する、画像処理用のPythonライブラリです。

2054

Final2x: カスタムモデルとNvidia 50シリーズGPUをサポートするクロスプラットフォーム画像超解像ツール

AIモデルを使用して画像をアップスケールし、解像度を向上させるクロスプラットフォーム画像超解像ツール。

2055

gocv: OpenCV 4 コンピュータビジョンライブラリ用の Go 言語バインディング

GoCV は OpenCV 4 の Go 言語バインディングを提供し、Go 開発者が高度なコンピュータビジョンとハードウェアアクセラレーションによる画像処理をアプリケーションに統合できるようにします。

2056

librealsense: RealSenseカメラから深度およびカラーデータをストリーミングするためのクロスプラットフォームライブラリ

RealSense深度カメラ用のクロスプラットフォームSDKであり、深度およびカラーのストリーミングを可能にし、コンピュータビジョンやロボティクス用のキャリブレーションデータを提供します。

2057

rerun: 物理AIおよびロボティクス向けのマルチモーダル・データレイヤーおよびビジュアル・デバッガー

物理AIのためのマルチモーダル・データレイヤーおよびビジュアル・デバッガー。開発者がマルチレートのセンサー・データをリアルタイムでログに記録、クエリ、および可視化することを可能にします。

2058

pcl: 0

2D/3D画像とポイントクラウド処理のための大規模オープンソースライブラリ。ロボティクスや3D認識への活用が広く lte_id: 0

2059

segmentation_models.pytorch: 800以上の学習済みエンコーダーを備えた画像セマンティックセグメンテーション用のハイレベルPyTorchライブラリ

幅広い学習済みエンコーダーとアーキテクチャを使用して、画像セマンティックセグメンテーション・モデルを簡単に作成・トレーニングできるハイレベルAPIを提供するPyTorchライブラリ。

2060

LinuxMD が Linux を Sega MegaDrive(Genesis)に導入

LinuxMD は EverDrive カートリッジを使用して Sega MegaDrive 上でフル Linux カーネルを起動できることを実証し、68000 ベースのコンソールで Unix が実現可能であることを示しています。

2061

Meshroom: 3D再構成およびコンピュータビジョン・パイプラインのためのノードベースのビジュアルプロジュアルプログラミング・フレームワーク

3D再構成およびコンピュータビジョン用のノードベースのビジュアルプログラミング・フレームワーク。AIとフォトグラメトリを使用して、ユーザーが複雑なデータ処理パイプラインを構築することを可能にします。

2062

open_clip: 大規模な対照学習型言語・画像および音声・テキストモデルのトレーニングとデプロイのためのオープンソースフレームワーク

OpenAIのCLIPのオープンソース実装であり、ゼロショット分類や検索のために大規模な対照学習型言語・画像モデルのトレーニングと使用を可能にします。

2063

carla: 自動運転システムのトレーニングと検証のためのオープンソースの都市走行シミュレータ

自動運転研究のためのオープンソースのシミュレータ。シミュレートされた都市環境において、自動運転システムの開発、トレーニング、および検証に使用されます。

2064

labelme: AI支援マスキングとマルチフォーマット・データセット・エクスポート機能を備えたグラフィカルな画像アノテーションツール

さまざまな形状やAI支援ツールを使用して画像をラベル付けし、コンピュータビジョン・モデル用のデータセットを作成できる、グラフィカルな画像アノテーションツール。

2065

cvat: 高品質なコンピュータビジョン用データセット構築のためのプロフェッショナルなデータアノテーションプラットフォーム

コンピュータビジョン向けの高品質な視覚的データセットを構築するためのオープンソースのデータアノテーションプラットフォーム。画像、ビデオ、および3Dアノテーションをサポート。

2066

AirSim: 自律走行車両およびAI研究のための高忠実度な視覚・物理シミュレータ

Unreal Engine上に構築されたドローンおよび車両用のオープンソースシミュレータであり、ディープラーニング、コンピュータビジョン、および強化学習におけるAI研究のためのプラットフォームとして設計されています。

2067

MaaAssistantArknights: Arknightsの日常タスクと基地管理を自動化する画像認識ベースの自動化アシスタント

画像認識とディープラーニングを使用して、Arknightsの日常タスク、基地管理、およびリソース稼ぎを自動化するArknights用自動化アシスタント。

2068

vit-pytorch: PyTorchで実装されたVision Transformer (ViT) とその派生モデルの包括的なコレクション

オリジナルのVision Transformer (ViT) と、画像分類のための数十種類の高度な派生モデルを実装した包括的なPyTorchライブラリ。

2069

label-studio: マルチモーダルなオープンソースデータラベリングツール(ML支援の事前ラベリングとアクティブラーニング付き)

オープンソースのデータラベリングツールで、音声、テキスト、画像、動画にアノテーションを付け、機械学習モデルの学習データを作成または改善できます。

2070

espnet: ASR、TTS、および話し言葉の理解のための包括的なエンドツーエンド音声処理ツールキット

PyTorchを使用して、ASR、TTS、音声翻訳、および音声強調のための統一されたフレームワークを提供するエンドツーエンドの音声処理ツールキット。

2071

leon: エージェント実行機能とローカルファーストのプライバシーを備えたオープンソースのパーソナルAIアシスタント

ツール、メモリ、およびエージェント実行機能を使用してタスクを実行し、プライバシーのためにローカルAIモデルをサポートするオープンソースのパーソナルAIアシスタント。

2072

Cursor iOS アプリがユーザーを同意なしに新しいプライバシーモードへ切り替える

Cursor iOS アプリをインストールすると、レガシーの「コードを保存しない」プライバシーモードから、より制限の緩い新しいモードへ自動的に移行し、レガシーオプションはアプリ内で復元できません。

2073

PlayStation Store スタジオ・カナル映画の削除

ソニーは、PlayStation Store のユーザーアカウントから数百本のスタジオ・カナル映画を返金なしで削除し、デジタル所有権の本質を巡る議論を呼び起こしました。

2074

米国最高裁判所、ジオフェンス令状は憲法上の保護が必要と判断

米国最高裁判所は、ジオフェンス令状は第四修正条項の保護に従わなければならないと判断し、位置情報サービスへのオプトインがユーザーのプライバシー権を放棄するという主張を退けました。

2075

Tidal AI ポリシー:AI 生成音楽の収益化停止

Tidal は、プラットフォーム上で AI 生成音楽の掲載は許可するものの、収益化を禁止する新しい AI ポリシーを導入し、ロイヤリティが人間アーティストに確保されるようにしました。

2076

HunyuanVideo-1.5: コンシューマー向けGPUで高品質な合成を実現する軽量8.3Bパラメータ動画生成モデル

コンシューマー向けGPUで高品質なtext-to-videoおよびimage-to-videoの合成を可能にする、軽量な8.3Bパラメータの動画生成モデル。

2077

OpenMontage: リサーチ、スクリプト作成、編集を統合してフルプロダクションパイプラインを実現するエージェント型ビデオ制作システム

リサーチ、スクリプト作成、アセット生成、および編集をオーケストレーションして、自然言語のプロンプトからプロフェッショナルなビデオを制作する、オープンソースのエージェント型ビデオ制作システム。

2078

Ornith-1.0 リリース: エージェンティック・コーディングのための自己改善型オープンソースモデル

Ornith-1.0は、Gemma 4およびQwen 3.5上でポストトレーニングされており、エージェンティック・コーディングとツール呼び出しに最適化された、MITライセンスの自己改善型オープンソースモデル(9Bから397B)のファミリーです。

2079

Outer Shell: SSH 用のネイティブ グラフィカルシェル

Outer Shell は SSH を介してリモートサーバーにブラウザベースのグラフィカルインターフェースを提供し、Unix ドメインソケットを使用してネイティブおよび HTML ベースのアプリを公開します。公開 HTTP ポートは不要です。

2080

Rocket LabがIridiumを取得

Rocket LabはIridiumを取得し、収益性の高い衛星通信ネットワークと貴重なスペクトラムを統合して、垂直統合型宇宙企業を構築しました。

2081

サムスン、SK Hynix、Micronが米国でメモリ価格操作で訴えられる

サムスン、SK Hynix、Micronは、DRAM供給の削減と古いメモリ規格の廃止を協調し、価格を吊り上げたとする米国の訴訟に直面しています。

2082

ZLUDA 6 リリース: 非NVIDIA GPU上で修正なしのCUDAアプリケーションを実行する

ZLUDA 6は、32ビットPhysXのサポート、Blender用の基本的なテクスチャ・サポート、および非NVIDIAハードウェア上でCUDAアプリケーションを実行するためのWindowsの使いやすさの大幅な向上を導入します。

2083

Mullvad VPN論争:共同創業者Daniel Berntssonの政治的寄付

Mullvad VPNの共同創業者Daniel BerntssonによるスウェーデンのÖrebro党への資金提供が、企業の中立性と私的な政治的寄付および企業価値の交差点についての議論を引き起こしている。

2084

AIとの付き合い方: 「魔法使いの弟子」問題の具体的な事例

Carson Grossは、hyperscript parserにおける実際のバグ修正を通じて、AIのソフトウェア開発における強みと弱みを探索し、AIが提案する解決策を盲目的に受け入れることの危険性を強調しています。

2085

BAIR 2026 卒業生ショーケース

バークレー人工知能研究所(BAIR)は、2026年度の博士課程修了生クラスを発表し、ロボティクス、大規模言語モデル、AI安全、およびヘルスケアにおける研究を強調しました。

2086

genai-processors: 非同期かつ構成可能なマルチモーダルAIパイプラインを構築するためのモジュール式フレームワーク

マルチモーダルコンテンツの処理とストリーミングを統一する、モジュール式、非同期、かつ構成可能なAIパイプラインを構築するための軽量なPythonライブラリ。

2087

instill-core: データ処理、パイプライン・オーケストレーション、およびモデルホスティングのためのエンドツーエンドAIインフラストラクチャプラットフォーム

非構造化データ、AIパイプライン、およびモデルデプロイのオーケストレーションを簡素化し、RAGやAIファーストなアプリケーションを構築するためのエンドツーエンドAIプラットフォーム。

2088

YTPro: AIによる動画要約と高度な再生コントロール機能を備えたカスタマイズ版YouTubeクライアント

Google Geminiを統合してAI動画要約を実現し、広告ブロックやコンテンツダウンロードツールを備えたカスタマイズ版YouTubeクライアント。

2089

alan-sdk-web: ビジネスロジックとUIのリアルタイム生成を可能にするインテリジェントなアプリプラットフォームSDK

Webアプリケーションにインテリジェントなレイヤーを組み込み、ビジネスロジックとUIコンポーネントのリアルタイム生成を可能にするSDK。

2090

presentation-ai: ローカルLLMとカスタムテーマをサポートするオープンソースのAIプレゼンテーションジェネレーター

アウトライン優先のワークフローを通じて、トピックからカスタマイズ可能なスライドを作成する、オープンソースのAI搭載プレゼンテーションジェネレーター。

2091

TTS-WebUI: 数十種類のオープンソースのテキスト読み上げおよび音声生成モデルを実行・管理するための統合ウェブインターフェース

幅広いオープンソースのテキスト読み上げ、音声生成、および音声変換AIモデルを管理・実行するための統合ウェブインターフェース。

2092

Gemini-API: Google Gemini ウェブアプリ用のリバースエンジニアリングされた非同期 Python ラッパー

Google Gemini ウェブアプリ用のリバースエンジニアリングされた非同期 Python ラッパー。画像生成、ディープリサーチ、カスタム Gems などの機能へのプログラム的なアクセスを可能にします。

2093

hallucination-leaderboard: 要約タスクにおけるLLMのハルシネーション率を追跡する公開リーダーボード

VectaraのHallucination Evaluation Model (HHEM)を使用して、異なるLLMがドキュメントを要約する際にどの程度ハルシネーションを起こすかを測定・比較する公開リーダーボード。

2094

semantic-router: semantic vector space を使用してルーティングを行う LLM およびエージェント向けの超高速な意思決定レイヤー

意味に基づいたルーティングを行うために、低速な LLM 生成ではなく semantic vector space を使用する、LLM およびエージェント向けの高速な意思決定レイヤー。

2095

transformer-explainer: GPT-2の内部動作を学習するためのインタラクティブなブラウザベースの可視化ツール

ブラウザ上でライブのGPT-2モデルを実行し、Transformerベースのモデルがどのようにテキストを予測するかをユーザーが学習するのを助けるインタラクティブな可視化ツール。

2096

ChatGPT-Shortcut: 複数のプラットフォームにわたるAI出力を向上させるための、厳選されたプロンプトライブラリおよび管理ツール

5,000以上のプロンプトを提供する厳選されたライブラリと、さまざまなAIプラットフォームにわたってカスタムプロンプトを整理、作成、共有するためのツールを備えたAIプロンプト管理ツール。

2097

morphic: ストリームされたJSONからリッチなインラインコンポーネントをレンダリングする生成UIを備えたAI検索エンジン

生成UIを使用して、プレーンテキストの代わりにリッチで引用付きの回答をインタラクティブなコンポーネントと共にレンダリングするAI搭載の検索エンジン。

2098

krita-ai-diffusion: Krita 用の生成 AI プラグイン。拡散モデルを統合して、精密な画像編集とペインティングを実現します

生成 AI 拡散モデルを Krita のペインティングワークフローに統合し、インペインティング、ライブペインティング、および精密な構造制御のためのツールを提供する Krita プラグイン。

2099

outlines: 型制約付き生成による構造化されたLLM出力を保証するライブラリ

生成を特定のPythonの型またはPydanticモデルに一致させるように制約することで、LLMからの構造化された出力を保証するライブラリ。

2100

Open-Generative-AI: ローカル推論とマルチモデル対応を備えた、制限のないAIビデオプラットフォームのオープンソース代替案

200以上のモデルを使用し、ローカル推論オプションとビジュアルワークフロービルダーを備えた、画像およびビデオ生成のためのオープンソースで制限のないAIスタジオ。