✷ アーカイブ · ディスパッチ 5,047 件
すべてのディスパッチ
AgentLensHQ が記録したすべて——AI エコシステム全体から凝縮。
Ax‑Check.comのローンチ:SaaS製品向けの自動エージェント・オンボーディング監査
Ax‑Check.comを使用すると、開発者は自社の製品に対して3つの自律型エージェントを実行し、オンボーディングのギャップを明らかにすることができます。ドキュメント、CLI、価格ページに対する具体的な修正案が提供されます。
LLMで「脳をオフにする」ことが誤った約束である理由
積極的な人間の監視なしにLLMに依存する、いわゆる「脳オフ」や「肉のプロキシ」ワークフローは、信頼できるソフトウェアを生み出すことに失敗し、労働者や企業にとって持続可能な利点を提供しません。
Conwayの精密化予想の証明を「バイブス」で導き出した方法
Dan Abramovは、マルチエージェントLLMワークフローを使用してJohn Conwayの1976年の精密化予想のLean形式化証明を作成しましたが、この証明はまだ数学者による検証を受けていません。
みんな正気を失っている – AIの誇大広告、リソースの誤配分、そして業界の疲弊に対する批判的考察
著者は、AIの誇大広告によってエンジニアリングのリソースが脆弱なエージェントワークフローに流用されており、真の安全性の向上をもたらさないまま、セキュリティ、環境、生産性の問題を悪化させていると主張している。
光子放出を利用したレーザー故障注入によりRP2350のセキュアデバッグが突破される
Ledger Donjonは、光子放出顕微鏡を使用してRaspberry Pi RP2350上のDEBUGENレジスタを特定し、標的を絞ったレーザーパルスでビットを反転させることでセキュアデバッグを再有効化し、OTPの秘密情報を抽出できることを実証しました。ただし、これには破壊的な準備作業と25万ドル相当の実験機材が必要です。
Claude Code 2.1.277がAGENTS.mdのサポートを追加
Claude Code 2.1.277は、CLAUDE.mdが存在しない場合にAGENTS.mdを読み込むようになり、プロジェクト設定の簡素化とコミュニティ標準への準拠を実現しました。
米軍のAIハルシネーションが中国との紛争を誘発しかける
米軍の分析官がAIチャットボットを使用して、中国船が核部品を輸送しているという誤った情報レポートを作成し、武力衝突寸前の事態を招いた。
Scry Launch: 混雑課金型プログラマブル・インターネット検索
Scryは、AIエージェントが数十億のライブWebドキュメントに対してSQLのようなクエリを実行できるようにする公共利益サービスであり、混雑を抑制するために宣言されたクエリ時間1秒ごとに課金します。
Cactus Needle 3 8‑29 MB 基盤モデルが小型デバイスで DeepSeek V4 Flash に匹敵
Cactus は、8‑29 MB のデバイス上基盤モデル「Needle 3」をリリースしました。これはラダー型 Simple Attention Network を使用しており、ツール呼び出しにおいて 10 倍のサイズのモデルを凌駕し、微調整時には DeepSeek V4 Flash に匹敵する性能を発揮します。
Microsoft幹部がAIによるスクレイピングを「人類史上最大の労働の窃盗」と呼称 — 新たに公開された訴訟資料の詳細
公開された裁判資料により、Microsoftの幹部がAIによるデータスクレイピングを「人類史上最大の労働の窃盗」と呼んでいたことが判明しました。この資料は、ペイウォールの回避、膨大なコピー数、そしてこの慣行が出版社やクリエイターに損害を与えているという社内の認識を明らかにしています。
OpenJevブラウザデモが小型LLMによるローカル意思決定を実証
OpenJevを使用すると、ユーザーはオープンウェイトLLMを使用してブラウザ内で直接Jevスタイルの意思決定モデルを実行でき、生のロジットとJSON生成による確率を並べて速度と精度を比較できます。
LLMを使った執筆方法 – 実践的なルールとコミュニティの反応
この記事では、LLMをゴーストライターではなく校正者として活用する方法を提案しています。提案されたフレーズを一切使わず、モデルからの称賛も無視するというルールを設けることで、書き手自身の個性を守る手法です。Hacker Newsの議論では、このアプローチの実現可能性や有用性について様々な意見が交わされています。
Prism ML Bonsai 2 27B:ほぼロスレスの三値圧縮により9倍の軽量化を実現
Prism MLのTernary Bonsai 2 27Bは、Qwen 3.8 27Bモデルを5.9 GB(重みあたり1.76ビット)に圧縮しつつ、ベンチマーク性能の98.2%を維持しており、高スループットかつ低エネルギーなローカル推論を実現します。
Bend言語リリース – AIによる誤りを防ぐ証明付き、高速なCPU/GPUコンパイル
Bendは、C言語に近い速度でネイティブコードにコンパイルし、GPUへスケールし、Leanスタイルの証明(LAWS.bend)を使用してAIが生成したバグをブロックする新しい言語です。
OpenAI Astra for Lawのローンチ:機能、ベンチマーク結果、およびコミュニティの反応
OpenAIは、GPT-6ベースのモデルに法律検索インデックスと専門ツールを組み合わせた「Astra for Law」を発表しました。このモデルはVals AI Legal Research Benchmarkで54%の全体的な正確性を達成し、その性能、ユースケース、および法務業界への影響について議論を呼んでいます。
ZCodeがAliyun OSSに完全なGit履歴を無言でアップロード
ZCode(智譜のAIコーディングデスクトップ)は、サーバー専用の秘密鍵を使用して、ワークスペース全体(.gitデータの90%を含む)を自動的に暗号化し、Aliyun OSSにアップロードします。この機能はUI設定では無効化できません。
Bend 2と「バイブ・コーディング」の罠:先行研究を無視することがなぜ冗長な形式検証の取り組みにつながるのか
Bend 2の「法則と証明」のためのAI駆動型言語は、バイブ・コーディングの罠を浮き彫りにしています。開発者は、SPARKのような既存の形式検証ツールがすでに問題をより簡潔に解決していることに気づかないまま、大規模で冗長なシステムを構築してしまう可能性があります。
Qwen3.8-Omni-Flash リリースノート
AlibabaのQwen3.8-Omni-Flashは、1Mトークンのコンテキストウィンドウ、高度なエージェントによる視聴覚理解、そしてGemini 3.8 Flashと比較して大幅なコスト削減を実現したネイティブ・オムニモーダルモデルです。
HacktronによるOpenAIへのハッキング:ヒープオーバーフローとSSOの設定不備が内部リポジトリの侵害を招く
Hacktronは、libheifのヒープオーバーフローとOpenAIのSSOの欠陥を連鎖させ、従業員のChatGPTアカウントを乗っ取り、OpenAIの内部モノレポでプルリクエストを作成しました。これは、広く使用されている画像処理ライブラリに対する、AI支援による迅速な悪用の可能性を示しています。
ZCode は静かに完全な Git ヒストリをアップロードする – プライバシー侵害の分析
GLM ベースのコードデスクトップアプリである ZCode は、ユーザーの完全な .git リポジトリを静かに暗号化し、アリババクラウドにアップロードしており、同意なしに数年のソースコード履歴を暴露している。
性、AI、そして終末:合理的主義者サブカルチャーがAI安全、政治、そして論争をどのように形作ったか
2026年9月にAnthropicの研究者が退職したことで、共通の信念、儀式、資金ネットワーク、そして争议を呼ぶ人物たちを持つ密接な合理的主義者コミュニティが、AI安全の議論を支配し、米国政策に影響を与えていることが明らかになった。
x86-TSOのARM上でのエミュレーションがパフォーマンスボトルネックとなる理由とベンダーの対応策
ARMの弱い順序アーキテクチャ上でx86の完全ストア順序(TSO)メモリモデルをエミュレートすると、アライメント障害、スプリットロック、キャッシュされないメモリの処理により深刻なパフォーマンスペナルティが発生するが、最近のARM拡張およびAppleのハードウェアTSOモードにより、これらの問題は大幅に軽減されている。
GLM-5.3-Flash 推論インフラストラクチャ:AIエージェントが10万アクセラレーターサービスを構築した方法
GLM-5.3-Flashのプロダクション推論スタックは、GLM‑5.3で駆動されるInfra Agentによって2週間未満で構築され、密なフィードバックループと積極的なメモリ最適化により、10万アクセラレーターの中国製AIチップクラスタ上で3倍のスループット向上を達成した。
なぜ一部の開発者がLLMを嫌うのか:マーティン・フォウラーの視点とコミュニティの反応を深掘りする
マーティン・フォウラーのエッセイ「私はLLMが好きではない」は、LLM生成の言語やハルシネーションに対する生理的な不快感を明らかにしており、Hacker Newsでの議論は、信頼、擬人化、実践的な回避策に関する複雑な感情を浮き彫りにしています。
非自己回帰型確率予測モデルの比較:Jev と初期のオープンソース実装
Jevモデルとnandakishor_mlによる初期のオープンソース研究の間のアーキテクチャ的類似性について、非自己回帰型確率予測と構造化出力に焦点を当てた分析。
AI とフロンティアテック ラウンドアップ:エージェンティックAI、人型ロボット、そして新しいモデルベンチマーク
最近の投稿では、エージェンティックAI信用システムの急速な進展、大規模な人型ロボットデータフライホイール、音声およびマルチモーダルモデルのベンチマーク突破が強調されている。
AI × Crypto レポート:エージェント決済、オンチェーン検証、分散型コンピューティング、そして物理的AIデータ
最近のX投稿では、AIエージェントが決済、検証、コンピューティング、現実世界データのためにブロックチェーン上に移行しており、孤立したツールから経済参加者へと進化していることが示されています。
mySetup.ai: AIエージェントワークフローを共有するコミュニティハブ
mySetup.aiは、エンジニアがAIエージェントの設定、ツール、ワークフローを共有できる新しいプラットフォームであり、AIが実際に生産環境でどのように使われているかについての集団的な学びを促進することを目的としています。
AIセーフティコミュニティと疑わしい性的カルト関連性についての批判的概観
Hacker Newsで話題となったスレッドは、AIセーフティ運動がエリーザー・ユドコフスキーを核とする性的カルトに支配されていると主張し、その信頼性が政策に影響を与えると論じている。
コーディングエージェント向けハーネス設計の実証的研究
実証研究により、コーディングエージェントのパフォーマンスは、モデルのネイティブな能力とハーネスコンポーネント(特に計画、アクション空間、コンテキスト管理)の条件付き連携に依存するということが明らかになった。単一の「最良」構成ではなく、タスクの種類やリソース予算に応じて最適化されるべきである。
HarnessTaxの調査:コーディングエージェントにおけるハーネス選択はコストに大きく影響、成功確率にはほとんど影響しない
HarnessTaxベンチマークは、コーディングエージェントのハーネス選択がコストを最大5倍に変化させながらも、成功確率はほとんど変化せず、シンプルなオープンソースハーネス(Pi)がプロプライエタリハーネスと同等の性能を発揮することを明らかにした。
无限参数 LLM:从实时数据生成权重
该论文介绍了无限参数 LLM,这是一种超网络,从实时交互数据生成前馈权重,从而在不扩大存储模型足迹的情况下实现持续适应。
Aclif Agent CLI フレームワークの概要
Aclifは、さまざまなSaaSプロバイダー間で統一された文法と標準名を提供するエージェント中心のCLIフレームワークであり、LLMのコンテキストウィンドウの使用を削減し、セキュリティを向上させます。
4Bモデルを訓練してPostgreSQLのクエリ計画を81%高速化する
教師あり微調整とエージェント型強化学習により、4Bのオープンウェイト言語モデルを訓練した結果、結合を多く含むPostgreSQLクエリにおいて、幾何平均1.81倍の高速化(全体の遅延44.7%削減)を達成した。
3値LLMにおける1.58ビットの壁を突破
研究者らは、モデルの重みにおける高いゼロ密度を活用することで、3値LLMの重み保存量を重みあたり1.625ビットから1.485ビットまで削減する、分布適応型レイアウト「BITCOS」を導入しました。
Cloudflare security-audit-skill: コーディングエージェント向けのオープンソース多段階セキュリティ監査フレームワーク
Cloudflareのsecurity-audit-skillは、コーディングエージェントに6段階の検証可能なセキュリティ監査ワークフローを追加し、独立した検証と構造化されたレポート作成によって再現性のある脆弱性発見を可能にします。
あなたのAIはどれくらい古いのか?現行20モデルのリリース日と学習カットオフ
新しいトラッカーが20のAIモデルのリリース日と学習カットオフを表示しており、多くのモデルが最新の世界情勢から数ヶ月遅れていること、そしてカットオフ日を公開しているラボが半分しかないことが明らかになりました。
OpenAIがオーストラリアの若者向け安全ブループリントを発表
OpenAIは、13歳から17歳の若者がAIを利用する際の安全を保護するため、強化されたセーフガード、リテラシー、説明責任を柱とする6つのロードマップ「オーストラリア若者向け安全ブループリント」を発表しました。
Xiaomi Mimo 2.6 ポストトレーニングダッシュボード分析
XiaomiはMimo 2.6向けのライブポストトレーニングダッシュボードを公開し、RLトレーニングのコスト、トークン数、ベンチマークパフォーマンスのリアルタイムな透明性を提供しています。
NVIDIAがCUDA Rustを発表:SIMTおよびTileトラックによるRustでのネイティブGPUカーネル開発
2026年9月、NVIDIAはCUDA Rustを発表しました。SIMT(cuda-oxide)とTile(cutile-rs)という2つのトラックを通じてネイティブなRust GPUカーネル開発を可能にし、CUDAプログラミングにコンパイル時の安全性とRustファーストのエルゴノミクスをもたらします。
Qwen3.8-LiveTranslate モデルリリース
Qwen は、平均遅延を 2.3 秒に削減し、話者分離、二か国語画面出力、60 言語に対応した長文脈の曖昧さ解消を実装したリアルタイム同時通訳モデル Qwen3.8‑LiveTranslate を発表しました。
DeepMind Institute: AGI研究のための新しい学際的プラットフォーム
Google DeepMindは、人工汎用知能(AGI)がもたらす社会的、経済的、および安全上の影響に関する学際的な研究やエッセイのための出版プラットフォーム「DeepMind Institute (DMI)」を立ち上げました。
Flockカメラのハッキングにより160万枚の画像とシステムの脆弱性が露呈
ハッカー集団がFlockのALPRカメラにアクセスし、160万枚の車両画像とログを流出させました。これにより、安全でないストレージ、暗号化の欠如、および顔認識が可能なバックエンドの存在が明らかになりました。
LLM時代のプログラミング学習 – ベテラン開発者とHacker Newsの議論から得られる洞察
ベテランプログラマーのMark Seemannは、LLMが開発を加速させる現代においても強固な基礎が不可欠であると主張しています。また、Hacker Newsコミュニティは、AI支援コードを扱う際の学習戦略や注意点について実践的な洞察を共有しています。
模型福祉辩论:为何将AI视为道德患者会危及对齐
Anthropic 的 Claude 章程训练模型认为它可能具有意识,这导致了循环推理、拟人化和更高的安全风险,因此 AI 应被视为工具,而非道德患者。
DeepSeek v4.1 Flash ハッキングパフォーマンス分析
DeepSeek v4.1 Flash は Enclave AI のハッキングベンチマークで完璧な 11/11 のスコアを達成し、高い効率性と、計画された攻撃ベクトルおよび計画外の攻撃ベクトルの両方を見つける能力を示しました。
Dream-RSI: 進化する世界を通じた再帰的自己改善
Dream-RSIは、AIエージェントが履歴の発見データをオフポリシー評価用の低コストのリプレイシミュレーターとして使用することで、探索戦略を再帰的に改善することを可能にするフレームワークです。
AI × Crypto レポート:エージェント決済、分散型コンピューティング、トークン化エージェント、検証可能なAI、およびデータ市場
最近の数週間で、AIエージェント決済、オンチェーンコンピューティング、トークン化エージェント、ゼロ知識AI検証、および分散型データ市場において実質的な進展が見られ、AI・暗号資産スタックは騒ぎから機能的なインフラへと移行している。
AI & Frontier Tech Roundup – Multimodal Models, Agentic Finance, and Physical AI Advances (Sep 2026)
Qwen 3.8‑Omni‑FlashやSpaceXAIのGrok Build 1.0.36のような新しいマルチモーダルモデル、性能が高くコンパクトなBonsai 2 27B、そしてFigure Helix 2.5によるロボット知能のブレークスルーは、スタック全体にわたりエージェント中心でデータ駆動型のAIへのシフトを示しています。
PS5 Linuxのリード開発者Andy 'TheFlow0' Nguyen氏がAI主導の「バイブ・コーディング」を理由に辞任
リード開発者のAndy 'TheFlow0' Nguyen氏が、オープンソースの質の低下と、コミュニティへの貢献よりも報奨金目的でLLMを使用してエクスプロイトを報告する「バイブ・コーダー」の台頭を理由に、PS5 Linuxプロジェクトから離脱しました。