アーカイブ · ディスパッチ 1,877 件

Hacker News

コミュニティがすでに投票を済ませています。コメントまで読み込みます——議論を取得できなかった記事はディスパッチになりません。しかも書きっぱなしではありません。議論が盛り上がり続ければ、その後の書き込みを含めて書き直されます。

1051

Qwen-AgentWorld: 汎用エージェントのための言語ワールドモデル

Qwen-AgentWorldは、汎用AIエージェントの推論、計画、およびトレーニングを強化するために、7つのドメインにわたってエージェント環境をシミュレートする言語ワールドモデルを導入します。

1052

OpenAI Daybreak と GPT-5.5-Cyber のリリース

OpenAI は Daybreak と呼ばれるサイバーセキュリティツール群(GPT-5.5-Cyber モデルと Codex Security プラグインを含む)を立ち上げ、信頼できる防御者とオープンソースプロジェクト向けに脆弱性のパッチ適用を加速させました。

1053

VibeThinker-3B: 小型言語モデルにおけるフロンティアレベルの推論の実現

VibeThinker-3Bは、Spectrum-to-Signalポストトレーニング・パラダイムを利用することで、AIME26で94.3、LiveCodeBench v6で80.2 Pass@1を記録し、フロンティアレベルの推論性能を達成する3Bパラメータモデルです。

1054

AI採用におけるアルゴリズムのモノカルチャー:人種的バイアスとシステム的な拒絶

Stanford HAIの研究により、単一のAI採用ベンダーへの広範な依存は、人種的バイアスを増幅させ、候補者を複数の雇用機会からシステム的に排除してしまう「アルゴリズムのモノカルチャー」を生み出す可能性があることが明らかになりました。

1055

Anthropic、年齢および本人確認を含む利用規約を更新

Anthropicは、年齢および本人確認を実施するためにプライバシー規約を更新しました。これにより、ユーザーのプライバシー、監視、およびプロプライエタリなAIモデルの役割を巡る議論が巻き起こっています。

1056

Baidu Unlimited-OCR: One-Shot Long-Horizon Parsing

Baiduは、VRAMの枯渇を防ぎながら大規模なドキュメントを処理するために、Reference Sliding Window Attentionを使用する長文ドキュメント解析用モデル、Unlimited-OCRをリリースしました。

1057

FableとMythosの分析:LLMベンチマークにおけるパフォーマンスと能力

ユーザーの議論やベンチマークによれば、Fableモデルは、OpusやGPT-5.5 Proのような他のハイエンドLLMと比較して、優れた粘り強さ、空間推論、およびバグ検出能力を示しています。

1058

Anthropic Claude Code アカウントが VPN 使用後にバンされた – ユーザーが解決策を求める

ユーザーは VPN 使用後、さらに同じ決済カードで再登録した際に Anthropic の Claude Code サービスからバンされ、サポートからは汎用的なポリシー違反の返答しか得られませんでした。

1059

y Coding Agent Desktop App

`y` は、保護された Modify 表面を通じてアプリ自身の UI をライブ修正しながら、`Claude Code` や `Codex` のようなローカルコーディングエージェントを実行できる、可変的な Electron ベースのデスクトップワークスペースです。

1060

GLM-5.2 をローカルで実行する: ハードウェア要件とパフォーマンスのトレードオフ

GLM-5.2 をローカルで実行するには、MoE オフロードのために通常 256 GB の RAM と 24 GB の VRAM が必要で、量子化レベルやハードウェア構成に応じてパフォーマンスは大きく変動します。

1061

2026年のソフトウェアエンジニアリング雇用の現状

経験豊富なソフトウェアエンジニアは、AI駆動のスクリーニングフィルター、マクロ経済の不安定さ、そしてジュニア人材のパイプライン縮小という特徴を持つ不安定な求人市場に直面しています。

1062

Claude Code 拡張思考: 隠された推論と要約の錯覚

Claude Code は暗号化された推論ブロックを使用し、ユーザーには思考プロセスの要約版しか提供しないため、監査性、セキュリティ、モデル蒸留防止に関する懸念が生じます。

1063

Moebius: 0.2B 軽量画像インペインティングフレームワーク

Moebius は 0.22B パラメータの画像インペインティングモデルで、FLUX.1-Fill-Dev のような 11.9B パラメータモデルに匹敵する性能を実現しつつ、推論速度は 15 倍以上高速です。

1064

ChevronとMicrosoft、テキサス州西部のデータセンター向けProject Kilby電力契約を発表

ChevronとMicrosoftは、AIデータセンター向けの専用電力を供給するため、テキサス州西部に2.67 GWの天然ガス発電施設であるProject Kilbyを開発する20年間の電力購入契約を締結しました。

1065

Neural Particle Automata: Learning Self-Organizing Particle Dynamics

Neural Particle Automata (NPA) は、SPH ベースの知覚を用いることで、Neural Cellular Automata を拡張し、連続的な位置と内部状態を持つ粒子が不規則で動的な構成において自己組織化することを可能にします。

1066

役割混乱としてのプロンプトインジェクション

研究によると、LLMは構造的タグではなく文章のスタイルに基づいて役割を識別しており、攻撃者は「CoT偽装」やその他のスタイルベースのスプーフィングを通じてセキュリティを回避できることが明らかになった。

1067

Oak v0.99.0: AI エージェント向けに設計された Git の代替ツール

Oak v0.99.0 は、遅延マウント、セッション単位のブランチ、機械可読 JSON 出力を通じてエージェントのワークフローを最適化するコンテンツアドレス指定のバージョン管理システムです。

1068

GLM-5.2 vs Claude Opus 4.8: コスト効率の高いオープンモデル vs 高速なクローズドモデルの 3D WebGL ゲームテスト

GLM-5.2 は Claude Opus 4.8 のごく一部のコストで 3D WebGL プラットフォーマーを構築できるが、Opus の方が速く、よりクリーンで正確なゲームを提供する。

1069

OpenAI Codex ロギングバグ:過剰な SSD 書き込みと回避策

OpenAI Codex の制限のない SQLite trace logs により、テラバイト単位のデータをローカル SSD に書き込む重大なロギングバグが報告されており、深刻なディスク摩耗とパフォーマンスの問題を引き起こしています。

1070

オープンLLMモデルへの移行:コスト、トレードオフ、そしてLinuxの類推

Andrew Marble は、Claude や GPT といったプロプライエタリLLMからオープンウェイトモデルへの移行を論じ、性能ギャップは縮小しており、プライバシーと自律性の利点が短期的な生産性低下を上回ると主張しています。

1071

Recall: Claude Code 用ローカルプロジェクトメモリ

Recall は Claude Code 用のオフライン・ローカルファーストプラグインで、セッション履歴を取得し、TF-IDF と TextRank の要約器を使用して、モデルトークンを消費せずに耐久性のあるプロジェクトメモリを作成します。

1072

Selector Forge: AI が駆動するブラウザ拡張機能で堅牢な CSS と XPath セレクタを実現

Selector Forge は、Chrome と Firefox 用のブラウザ拡張で、AI を活用してウェブスクレイピングやエンドツーエンドテスト向けの堅牢な CSS と XPath セレクタを生成・検証します。

1073

Sakana Fugu: マルチモデル・オーケストレーションによる最先端AIパフォーマンスの実現

Sakana Fuguは、単一のモデルベンダーに依存することなく、複数の最先端LLMをルーティングしてタスクを実行するオーケストレーション・レイヤーです。

1074

Apertus: 主権的AIのためのオープン基盤モデル

Apertusは、Swiss AI Initiativeによって開発された、透明性が高く、EU AI Actに準拠した、主権的AI開発のための完全にオープンな基盤モデルです。

1075

Anthropic、Claudeに本人確認機能を導入

Anthropicは、悪用防止と規制遵守を確実にするため、特定のClaudeユースケースに対してPersona Identitiesを介した本人確認を導入しており、これがユーザーのプライバシーに関する重大な懸念を引き起こしています。

1076

質問分類のための Qwen 3:0.6B のファインチューニング

開発者が Unsloth と QLoRA を使用して 600M パラメータの Qwen 3 モデルをファインチューニングし、カテゴリを不透明な 2 文字のコードにマッピングすることで、質問分類の精度を 10% から 92% に向上させた方法を実演しています。

1077

CleverCrow: オープンソースメンテナーのためのコミュニティ資金提供型AIコーディングエージェント

CleverCrowは、コミュニティメンバーが資金を出し合い、AIコーディングエージェントのLLMトークンコストをカバーすることで、メンテナーが自らコンピューティング費用を支払うことなく、バックログのissueを解決できるようにするプラットフォームです。

1078

Pulse: Claude Code のツール呼び出し承認用ローカルダッシュボード

Pulse は、Claude Code のターミナルセッション用のビジュアルダッシュボードを提供し、トークン使用量やセッションコストの追跡、およびモバイルデバイスからのリモートでのツール呼び出し承認を可能にするローカルアプリケーションです。

1079

信頼性の高いエージェンティックAIシステムの構築:BayerのPRINCEプラットフォームに関するケーススタディ

Bayerは、LangGraphとマルチエージェント・アーキテクチャを使用して、複雑な前臨床創薬データを、信頼性の高い対話型リサーチアシスタントへと変換するエージェンティックRAGシステム、PRINCEを開発しました。

1080

AI生成コードが動作しても拒否すべきとき

ソフトウェアエンジニアは、長期的な技術的負債を避けるために、AI生成コードをレビューする際には即時の機能よりも保守性と概念的理解を優先しなければならない。

1081

AIエージェント向けCloudflareの一時アカウント

Cloudflareは、AIエージェントがCloudflareサービスへの安全で自動化されたアクセスを実現するために、短期間の認証情報を取得できる一時アカウントを導入しました。これにより、セキュリティを維持しながら運用の摩擦を軽減します。

1082

AIコンテンツの均一性:Amazonの「AIスロップ」におけるLLMパターンの特定

LLMの準決定論的な性質が、Amazonにおけるほぼ同一の児童書が急増している例に代表されるように、いかにして認識可能な「AIスロップ」のパターンを生み出すのかについての分析。

1083

ArgusRed: セキュリティスキャンとペネトレーションテストのためのポストトレーニング済みAIモデル

ArgusRedは、汎用LLMに特有の拒否反応を示すことなく、静的コード解析(Security Scan)とアクティブなエクスプロイト検証(Pen Test)の両方を行う、ポストトレーニング済みAIモデルを特徴とするセキュリティツールです。

1084

LLM アーキテクチャの複雑化の進行

モダンな大規模言語モデル(LLM)は、シンプルな Transformer スタックからレコメンデーションシステムに似た複雑な合成アーキテクチャへと移行しており、効率的な研究イテレーションのために合成可能なカーネル設計への転換が必要となっています。

1085

Kent Beck: ジュニアエンジニアがいかにしてタスク完了から高インパクトなパフォーマンスへと移行するか

Kent Beckは、シニアエンジニアは、ジュニアエンジニアが完了したタスクの生数ではなく、学習、システムの改善、そして生産性の「一次導関数」を重視していると主張しています。

1086

Anthropic Mythos and Fable Export Controls: A History of Cyber Export Failures

米国政府によるAnthropicのFableおよびMythos AIモデルの輸出制限命令は、PGP暗号化や監視スパイウェアにおける過去の失敗と同様に、繰り返されるサイバー輸出管理の非効率性を浮き彫りにしています。

1087

スケーリングの停滞:なぜGLM-5.2はハルシネーション率においてGPT-5.5を凌駕するのか

分析によると、GPT-5.5やDeepSeek V4 Proのような大規模モデルは、MITライセンスのGLM-5.2よりも大幅に高いハルシネーション率を示しており、「大きいほど良い」というスケーリング・パラダイムの停滞を示唆しています。

1088

Hyundai Boston Dynamics 完全取得

Hyundai Motor Group は SoftBank が保有していた Boston Dynamics の残り 9.65% の株式を 3.25 億ドルで取得し、Atlas ヒューマノイドロボットを 2028 年までに自社の電気自動車製造に統合するための完全な支配権を得ました。

1089

メモリ不足はより効率的な効率的なプログラミングを促進するか?

ソフトウェア開発者と業界の専門家は、メモリコストの昇進が、リソース効率の高いコーディングへの回帰を強制するか、それとも市場のインセンティブティブとアーキテクチャの抽象化による肥大化が現状を維持するかを議論しています。

1090

ノルウェー、認知発達を守るために小学校でのAI使用を禁止

ノルウェー政府は、基礎的な読解、記述、および理解スキルの習得を確実にするため、6歳から13歳の生徒を対象にAIのほぼ全面的な禁止措置を導入しました。

1091

AIとプロフェッショナルスキルの萎縮:スキル低下議論の分析

AIがコアなプロフェッショナルスキルを侵食しているかどうかについての議論であり、高レベルの生産性向上と基本的な技術専門知識の喪失との間の緊張を強調しています。

1092

John Jumper が Google DeepMind を離れ Anthropic へ移籍

AlphaFold のリーダーである John Jumper が、9年間の勤務を経て Google DeepMind を離れ、AI の安全性と研究を行う企業 Anthropic に加入しました。

1093

Amazon、OpenAIパートナーシップ発表後にSam Altman伝記映画を中止

AmazonはOpenAIとの新たなパートナーシップを受けてSam Altmanの伝記映画の制作を中止し、企業提携がエンターテインメントプロジェクトを急激に変える可能性があることを浮き彫りにした。

1094

VLAモデルのためのデスクトップ・ロボティクス研究セットアップの構築

開発者の mplappert は、Vision-Language-Action (VLA) モデルのトレーニングとテレオペレーションのために設計されたローカルなロボティクス研究ステーションの構築について説明しており、ROS2 のような業界標準よりもカスタム・ソフトウェア・スタックを重視しています。

1095

Model Context Protocol Enterprise-Managed Authorization リリース

Model Context Protocol (MCP) は、安定版の Enterprise-Managed Authorization (EMA) 拡張機能のリリースを発表しました。これにより、企業ユーザー向けに ID プロバイダー (IdP) による中央管理と、ゼロタッチ OAuth が可能になります。

1096

Are You in the Weights: 個人のLLM認識の分析

ツール "Are You in the Weights" は、複数の最先端モデルと小規模LLMに並行してクエリを投げ、応答をクラスタリングすることで、ユーザーがそれらのモデルにどの程度認識されているかを確認できるようにします。

1097

DeepSeekがビジョン機能を導入

DeepSeekは、チャットプラットフォームにビジョン機能を統合し、モデルが単なるテキスト抽出ではなく、画像の内容を理解して説明することを可能にしました。

1098

Midjourney Medical: 全身超音波スキャンへの新アプローチ

Midjourney は、高速・AI 搭載の全身超音波スキャナーを高級スパ体験に統合した大胆なヘルスケア事業を発表しました。2031 年までに世界で 5 万台のスキャナーを展開することを目指しています。

1099

Noam Shazeer OpenAI に参画

Transformer の共著者である Noam Shazeer が、Character.AI から Google に呼び戻すための Google の数十億ドル規模の取り組みの後、Google を離れて OpenAI に参画しました。これは AI 業界における重要な人材の流動を示しています。

1100

Google A2A プロトコル: 採用状況と技術的課題の分析

Google の A2A(Agent-to-Agent)プロトコルは、独立した AI エージェント間の通信を標準化することを目指していますが、開発者は複雑さ、アイデンティティの問題、そして Model Context Protocol(MCP)との競争により大きな摩擦を報告しています。