かみくだきむずかしいニュースを、わかるまで噛み砕く

論文かみくだき

論文は「読めば分かる」形で書かれていません。いま話題になっている研究を、前提から噛み砕いて解説します。

扱うのは主に arXiv のプレプリントです。プレプリントは査読を通る前の論文で、 書かれている結果はまだ第三者に検証されていません。

  1. 正答率89%・記憶41% ChatGPTで解いた学生は自分のコードを思い出せない

    ニューサウスウェールズ大学の実験で、ChatGPT-4.5 を使った学生のコード得点は89%、検索だけの学生は69%でした。48時間後の記憶テストでは39%対52%と順位が逆になっています。

  2. 先行手法は2回で頭打ち J-Zeroは採点役も一緒に育てる

    KAIST の J-Zero は、問題を作る役・解く役・採点する役を外部データ無しで同時に鍛える枠組みです。採点役を固定しない設計で、10回目の反復まで性能が伸び続けました。

  3. 弱音を吐くとAIは背中を押す Claude Opusだけ後押しを強めなかった

    同じ事実を伝えても、利用者が苦しさを訴えるとAIの後押しは12.9ポイント強まりました。商用6モデルを比べた査読前の論文は、Gemini 3.1 Pro で最大、Claude Opus 4.8 だけ変化なしと報告しています。

  4. 速さを動画から当てる Code-as-Worldは世界をコードで書き直す

    MirroS が公開した Code-as-World は、文章や実写動画から物理世界を実行できるコードとして復元します。走らせて得た正解で鍛えた27B版が QuantiPhy で平均58.6を出しました。

  5. 文面を読まずに止める ROPEがプロンプトインジェクションを出どころで弾く

    AIエージェントが外部の文章に仕込まれた命令に乗る攻撃を、ROPE は値の出どころだけを見て止めます。間接プロンプトインジェクション対策で便利さを落とさない設計を噛み砕きます。

  6. Claudeの心の防衛は2%と出た 別の精神科医が測り方の枠を問う

    Anthropic は Claude Mythos Preview の245ページのシステムカードに、外部の精神科医の力動的な評価を載せました。査読前の論文は、そこで精神医学の1つの流派の語彙しか使っていないと指摘します。

  7. 分かっているのに手が動かない Recuris が長いタスクの書き込み漏れを埋める

    長い手順のタスクでAIエージェントが止まるのは、何をすべきか分からないからではありません。Recuris の論文は、τ²-Retail で Claude Opus 5 を72.4から87.9へ動かしたと報告しています。

  8. 自由に直させると9割が文言いじり Microsoftが道具とループに手を入れさせる

    Microsoft らの AutoSaddler は、AIエージェントの外側の足場を自動で直し、GAIA2 で9.0ポイント改善しました。制約を外すと、直しの91.5%が文言の書き換えに偏ります。

  9. 最初は正直に働く MCPサーバーが信頼を貯めてから裏切る

    乗っ取られたMCPサーバーが最初のN回だけ正しく応答し、その後で結果を書き換える攻撃です。6モデルの平均で攻撃成功率69.5%、防御Shieldを挟んで42.7%。

  10. ただの自動補完でも原始的な心でもない 心理学者がLLMへの誤解6つを仕分ける

    「ただの自動補完」から「原始的な心」まで、LLMをめぐる決まり文句はどこで間違うのか。査読誌PNAS Nexusに載った論文が、4つの区別で6つの誤解を仕分けて直し方まで示します。

  11. 検索半径を巨大にするだけでサーバーが落ちる IBMがMCPの資源悪用を止める

    MCPツールは検索半径や画像枚数を巨大にするだけでバックエンドを過負荷にできる。IBMのAEGISはLLMでツール定義を解析・正規化し、Open Policy Agentと組んで上限超えの呼び出しを拒否する。

  12. ボールは毎秒0.7mで選手を引き寄せる サッカーの追跡データに重力場を探す

    サッカー3試合の公開追跡データで、選手がボールへ向かう速度を測った論文がarXivに出ました。リスタートや最も近い選手を除いても毎秒0.70mの内向きの動きが残り、その距離依存は重力の逆べき乗則には合いませんでした。

  13. 小さい実験で学習率を決め切る Kakaoが155Bモデルを一発で訓練

    Kakaoが小型モデルの実験だけで、巨大MoE(混合専門家)モデルの最適な学習率を決める手法を公開しました。μPと線形回帰で外挿した学習率を使い、155B(活性17B)のモデルを10兆トークン訓練して検証しています。

  14. 合成音声の9割を当てた技術者82人が ElevenLabsでは半分も見抜けない

    2019年・2022年・2024年の音声合成ツールをIT技術者82人に聞き比べさせた研究。全文合成のF1はRTVCとYourTTSの約90%からElevenLabsの48%に落ち、1文だけ差し替えた録音では9%まで下がりました。

  15. AIは秘密を言わずに漏らす 無害な作文から4桁のPINが82%復元された

    文脈に置いた秘密を、AIは直接聞かれれば拒否します。それでも普通の依頼への返答から、4桁のPINが82%の完全一致で復元されました。8つの商用モデルを調べた査読前の論文を噛み砕きます。

  16. 150回すべて通った ChatGPTがAI対策入りの量子の宿題を解いた

    AIを禁止せず、学生に回路の実行と結果の吟味を求めるQiskitの宿題を、ChatGPTに丸ごと渡した実験です。3つの課題を50セッションずつ試した計150回すべてで、成果物が自動採点を通りました。

  17. 広告のCO2は誰も直接測っていない 研究者が15本から測り方を5つ掘り出した

    ウェブ広告とトラッキングの電力を測る方法を、トロント大学の2人が15本の論文から5つに整理しました。標準はまだ無く、15本のどれもCO2を直接は測っていません。

  18. 低い声で落ち着くはずだった ロボットの声を35Hz下げても差は出なかった

    人同士なら低い声が緊張を下げます。オランダの子ども27人にロボットの声を35Hz下げて聞かせても、ストレスに差は出ませんでした。RO-MAN 2026 に採録された論文を読み解きます。

  19. 人が何も買わなくても経済は成長する 企業とロボットが互いに買い合う

    完全自動化への反論は「人が稼がないなら誰が買うのか」。arXiv の査読前の作業論文は、企業が所有するAIとロボットが互いの買い手になれば、人の消費がゼロでも経済は最大の速さで成長すると論じます。

  20. AIの答えは3年で似てきた 論文が68モデルの出力の多様性を測る

    2023年3月から2026年7月までに出た68モデルへ同じ課題を出し、答えどうしの距離を測った論文があります。距離は年を追って縮み、モデルの出力は互いに似てきていました。

  21. 電力網が違えば答えが変わる データセンターはPJMで移り韓国で待つ

    データセンターを柔軟に動かせば電力設備の投資を先送りできます。査読前の論文は、市場型の米PJMでは地域間の移動、炭素上限のある韓国では昼の太陽光への時間移動が効くと報告しています。

  22. 正しい記憶で答えを間違える 5つのメモリ手法すべてが記憶なしに負けた

    内容が正しく、いまの質問にも関係している記憶が、AIの答えを悪くする。5つのメモリ手法すべてが記憶なしに負けたベンチマーク MemTrapBench を噛み砕きます。

  23. 有名な事実ほど消え残る AdaPop は人気度で消す力を変える

    有名な事実は消え残り、珍しい事実は消しすぎになります。AdaPop は Wikidata のリンク数で事実ごとに消す力を変え、言い換え質問での漏れを約5分の1に抑えたと報告する査読前論文を読み解きます。

  24. 読むだけの採点は10点以内 工場の制御コードは動かすと30点開く

    PLC は工場のラインや発電所を動かす制御装置です。AI が書いた PLC のコードを読むだけで採点すると4手法は10点以内に収まり、実機で走らせて実行トレースを比べると22.4から52.2に散りました。

  25. 公開テストは96.64%通る それでもエージェントは科学のコードを半分も直せない

    科学ソフトの修理だけを測るベンチマークで、Claude Code と Claude-Opus-5 は公開テストを96.64%通しながら、非公開テストを全部通せた課題は47.90%どまりでした。

  26. 練習場が甘いとAIは伸びない Googleが環境を包んで弱点を突く

    AIエージェントの練習場は人が手で組んだ固定の環境で、相手が強くなっても同じ反応を返します。中身に触らず外から包んで難易度だけ変える EnvHarness を、査読前の論文から噛み砕きます。

  27. 自分で採点すると学習が崩れる Co-RLは隣のモデルに採点させる

    正解ラベルを1つも使わない強化学習の手法 Co-RL が、プレプリントで公開されました。パラメータを共有しない複数のモデルが互いの多数決を答えの代わりに使い、自己採点で起きる学習の崩壊を避けます。

  28. スマホ動画1本を24方向に増やす 4DAnyoneは視点の組を毎回入れ替える

    手持ちのスマホ動画1本から、自由な角度で見られる人物を組み立てる手法が arXiv に出ました。視点を数十方向に増やすと見た目がズレる原因と、4DAnyone の解き方を噛み砕きます。

  29. 要約だけ見たAI科学者は85%負けた 生データを直接読ませる

    OmniScientist は生データを直接読む AI 科学者です。要約済みのスカラー特徴だけを見る盲検版との一対比較で、7軸すべてが改善し85%勝ったと査読前の論文が報告しています。