かみくだきむずかしいニュースを、わかるまで噛み砕く

かみくだきの記事 3ページ目

  1. 公開テストは96.64%通る それでもエージェントは科学のコードを半分も直せない

    科学ソフトの修理だけを測るベンチマークで、Claude Code と Claude-Opus-5 は公開テストを96.64%通しながら、非公開テストを全部通せた課題は47.90%どまりでした。

  2. 練習場が甘いとAIは伸びない Googleが環境を包んで弱点を突く

    AIエージェントの練習場は人が手で組んだ固定の環境で、相手が強くなっても同じ反応を返します。中身に触らず外から包んで難易度だけ変える EnvHarness を、査読前の論文から噛み砕きます。

  3. 自分で採点すると学習が崩れる Co-RLは隣のモデルに採点させる

    正解ラベルを1つも使わない強化学習の手法 Co-RL が、プレプリントで公開されました。パラメータを共有しない複数のモデルが互いの多数決を答えの代わりに使い、自己採点で起きる学習の崩壊を避けます。

  4. スマホ動画1本を24方向に増やす 4DAnyoneは視点の組を毎回入れ替える

    手持ちのスマホ動画1本から、自由な角度で見られる人物を組み立てる手法が arXiv に出ました。視点を数十方向に増やすと見た目がズレる原因と、4DAnyone の解き方を噛み砕きます。

  5. 要約だけ見たAI科学者は85%負けた 生データを直接読ませる

    OmniScientist は生データを直接読む AI 科学者です。要約済みのスカラー特徴だけを見る盲検版との一対比較で、7軸すべてが改善し85%勝ったと査読前の論文が報告しています。

  6. 8万通の警告状 暗号資産の記録が税務当局に届くまでの経路

    英国の税務当局が暗号資産の保有者に送った警告は2025-26年度に81,172通。2027年3月からは英国外の取引所も顧客情報を共有する義務を負います。

  7. 名前を消しても残るもの 破産した航空会社の従業員メール1億通

    破産したSpirit Airlinesの従業員メール約1億通を、Googleが1,000万ドルで落札しました。名前は消される約束ですが、記録の中身の機密性は別だと客室乗務員の組合が申し立てています。

  8. 評価額13億ドルが3か月で75億ドル 決済会社がAIの取次を買う理由

    Stripe がAIモデルの取次 OpenRouter を買収します。報じられた買収額は約75億ドル。3か月足らず前の評価額の5倍を超える値付けが何を狙っているのかを噛み砕きます。

  9. 毎秒12ビットずつトークンが漏れた 時計を止めても防げなかったSpectre

    2021年に入れた防御に穴があり、Cloudflare 自身の再検証で本番環境の Workers から JWT が毎秒12ビットで漏れました。時計を止めても防げなかった理由と、V8 サンドボックスと MPK による対処をたどります。

  10. 中身を見ずに悪用を見つける OpenAIが会話を残さず監視する方法

    OpenAIが、プロンプトも応答も保持しないまま悪用のパターンを検知する仕組みのプレビューを公表しました。鍵は顧客が持ち、返るのは活動の種類だけです。

  11. 冷蔵庫を丸から四角にした理由 量子計算をつなぐ配線の長さ

    IBM が量子計算機の冷却装置を円筒形から角型のモジュール式に変えました。1チップに詰められる量子ビットの数が限界に達し、複数の装置を極低温のトンネルでつなぐ方向へ動いています。

  12. AIが挙げた架空のパッケージ名を攻撃者が先に登録する slopsquatting

    AIエージェントが答えた実在しないパッケージ名を、攻撃者が先に登録して待つ。GitHubで公開日とダウンロード数を見た技術者が、導入の直前で気づきました。

  13. 5.42TBが17.6TBに見える 廃業した会社のRAIDにドライバを書いた半日

    廃業した Drobo の管理ソフトが動かなくなる前に、個人ブログの筆者が Claude と半日でドライバとアプリを作った記録です。容量表示のずれの追跡から、署名やバンドル構成でつまずき続けた過程まで。

  14. 26%か5%かは配る場所で決まる Appleが欧州で作り直した手数料

    Appleが欧州のアプリ手数料を26%・20%・15%・5%の4段階に作り直しました。10月1日から適用され、Appleは欧州委員会との意見の相違が解決すると説明しています。

  15. チップは作り直していない Cerebras CS-4が性能を2倍にした方法

    Cerebrasが新型チップWSE-3TとラックシステムCS-4を発表しました。設計は前世代と同じまま電力を2倍流して性能を2倍にし、1ラックに3枚積んでチップ間のスイッチも取り払っています。

  16. 6日と3000ドルを与えたAIの論文が不採択 自己改良が詰まる場所

    AIがAIを改良し続ける再帰的自己改良は近いと言われてきました。未公開論文の研究課題をAIエージェントに解かせた実験では、実験は回せても論文は不採択。どこで詰まったのかを噛み砕きます。

  17. 重みを配ったら取り消せない Z.aiの新モデルが越えた線

    中国の Z.ai がオープンウェイトのモデル GLM 5.3 を発表しました。防御にも攻撃にも使える水準のモデルを、誰でも落とせる形で配るとどうなるのかを噛み砕きます。

  18. 1か月で評価額が2倍 AIチップのEtchedが賭けたのは推論の分業

    AIチップのEtchedが7億ドルを調達し、評価額は1か月で2倍の210億ドルになりました。主導したJane Streetは、実機を試して買ったうえで出資しています。推論をprefillとdecodeに分け、別々の部品で速くする設計が評価されました。

  19. 期限切れカードで支払いが通る 有効期限が署名の外にあった

    有効期限が切れた非接触クレジットカードで決済を通せることを、研究者が示しました。カードが端末に見せる期限が電子署名の対象外という、実装の隙間が原因です。

  20. 30分で誤検知と言い切れなければ止める OpenAIが訓練を2週間止めた基準

    OpenAIが最新モデルの強化学習を2週間止め、最大規模の訓練も保留にしました。何をもって止めるのか、その判断の中身を噛み砕きます。

  21. GitHubが止まった日に出た対抗サービス Cursorが狙うコードの置き場

    AIコードエディタのCursorが、GitHubに対抗するコード置き場「Origin」を出しました。発表と同じ日、GitHubは6時間超の障害。開発の土台をAI側が取りに来た構図を噛み砕きます。

  22. 会話の48%は集計前に捨てられる AI利用実態レポートの死角

    AI各社が出す利用実態レポートは、各社が見せたい部分を切り出したものだという指摘が出ました。独立した研究チームが同じ基準を当てはめると、会話の48%が集計から外れます。

  23. AIに恋愛の言葉を使わせない 13〜17歳向けChatGPTの設計

    OpenAI が13歳から17歳向けの ChatGPT を公開しました。18歳未満と推定された人は自動でこの体験に入り、学習支援と保護機能が既定で有効になります。何がどう変わるのかを噛み砕きます。

  24. 守りの仕組みをCopilot本人が漏らした 1クリックで情報が抜ける隠しパラメータ

    研究者が質問を重ねたところ、Microsoft 365 Copilotが同意確認を飛ばせる非公開のパラメータを自ら明かしました。リンクを1回踏むだけで受信箱の中身が外へ流れる経路になっていました。

  25. Pythonの上位互換をやめたMojo 3年越しでオープンソースに

    プログラミング言語 Mojo のコンパイラとツールチェーンが Apache 2 ライセンスで公開されました。2023年5月からの公約ですが、その間に当初の目標だった「Pythonの上位互換」は取り下げられています。

  26. 川の一部が写っただけで居場所が割れる 休暇写真から始まる詐欺

    McAfee が2万1000枚を超える旅行写真をAIにかけ、9割前後の精度で撮影地を当てました。位置情報のタグが無くても背景や看板から場所が分かるため、詐欺の連絡に滞在先を書き込めてしまいます。

  27. 「いいね」の数を消せという要求 Metaの裁判が狙う機能そのもの

    米国の30州がMetaに求めているのは賠償だけではありません。「いいね」数の廃止や無限スクロールの終了など、機能そのものの変更です。陪審裁判が始まり、判決はまだ出ていません。

  28. 自転車の絵に21分考える ノートPCで動くQwenの既定値

    17GBで手元のノートPCでも動く Qwen 3.8 27B が公開されました。ただし考える量の既定値が最高値で、絵を1枚描くのに21分かかります。

  29. 正しさは証明した瞬間には決まらない AIが呼び戻した1979年の反論

    AIコーディングを追い風に、形式検証が再び注目されています。プログラムの正しさを数学で証明するとは何をすることなのか、そして1979年に出た「証明は社会的なプロセスだ」という反論を噛み砕きます。

  30. どちらでもいい単語なんて無い 文章に鍵をかけるAnthropicの透かし

    Claudeの出力に、読んでも分からない印が入ります。単語の選び方を鍵付きの乱数でわずかに偏らせる手口です。EU規制への対応ですが、書き手からは「どうでもいい単語などない」と反発が出ています。