かみくだきむずかしいニュースを、わかるまで噛み砕く

かみくだきの記事 2ページ目

  1. 最初は正直に働く MCPサーバーが信頼を貯めてから裏切る

    乗っ取られたMCPサーバーが最初のN回だけ正しく応答し、その後で結果を書き換える攻撃です。6モデルの平均で攻撃成功率69.5%、防御Shieldを挟んで42.7%。

  2. 自前のメールサーバーが10年で半減 Google Workspaceが21.8%を占める

    人気ドメイン100万件のうち自前でメールサーバーを動かす割合が、2016年の44.6%から2026年は22.4%に下がりました。Google WorkspaceとMicrosoft 365の2社が38.6%を扱っています。

  3. AI検索の答えを狙う Hanover Instituteが1か月で100本超を出した

    イスラエルが費用を負担するシンクタンク Hanover Institute が、1か月弱で100本超の記事を公開しました。検出ツールは調べた3本を全文AI生成と判定し、サイトには llms.txt が置かれています。

  4. 速さと省電力はどちらか選ぶものだった OpenAIのJalapeñoが両方取る

    OpenAIが自社設計の推論チップ Jalapeño の測定結果を公開しました。公開モデル3つで電力あたりの仕事量が1.5〜1.9倍、応答時間は1.7〜3.6分の1。二択をどう外したのかを噛み砕きます。

  5. 10万3265ドルを払える会社だけ 米国がH-1Bビザの値段を上げる

    米国土安全保障省がH-1Bビザに10万3265ドルの手数料を課すと発表しました。前回の10万ドルは6月に無効になり、その間に地方の病院とアラスカの公立学校で人手不足が悪化していました。

  6. 6桁のPINをやめた WhatsAppが二段階認証をパスワードに変える

    WhatsAppの二段階認証が6桁のPINから、英数字と記号を使えるパスワードに変わりました。Androidの着信画面には発信者の情報が増え、パスキーの設定者は10億人を超えました。

  7. 「これ」と言われても分からない GoogleがAIに手を生やして指させる

    Google XR が、XRの中で話すAIに手ぶりを付けた試作機 AgentHands を CHI 2026 で発表しました。12人の実験で、位置と動作の理解が有意に上がりました。

  8. ただの自動補完でも原始的な心でもない 心理学者がLLMへの誤解6つを仕分ける

    「ただの自動補完」から「原始的な心」まで、LLMをめぐる決まり文句はどこで間違うのか。査読誌PNAS Nexusに載った論文が、4つの区別で6つの誤解を仕分けて直し方まで示します。

  9. 検索半径を巨大にするだけでサーバーが落ちる IBMがMCPの資源悪用を止める

    MCPツールは検索半径や画像枚数を巨大にするだけでバックエンドを過負荷にできる。IBMのAEGISはLLMでツール定義を解析・正規化し、Open Policy Agentと組んで上限超えの呼び出しを拒否する。

  10. ボールは毎秒0.7mで選手を引き寄せる サッカーの追跡データに重力場を探す

    サッカー3試合の公開追跡データで、選手がボールへ向かう速度を測った論文がarXivに出ました。リスタートや最も近い選手を除いても毎秒0.70mの内向きの動きが残り、その距離依存は重力の逆べき乗則には合いませんでした。

  11. 小さい実験で学習率を決め切る Kakaoが155Bモデルを一発で訓練

    Kakaoが小型モデルの実験だけで、巨大MoE(混合専門家)モデルの最適な学習率を決める手法を公開しました。μPと線形回帰で外挿した学習率を使い、155B(活性17B)のモデルを10兆トークン訓練して検証しています。

  12. Waymoは週50万回走る それでも規則づくりが追いつかない

    米国でロボタクシーの規則づくりが揺れています。ニューヨーク州は解禁案を撤回し、ワシントンDCは200台上限と1マイル15セントの課金を審議しています。Waymoの有料乗車は11都市で週50万回に達しました。

  13. 実行ファイルがSQLiteデータベースになる ELFをテーブルに移してそのまま起動する

    SQLiteのファイルに実行権限を付けると、そのまま動く。Farid Zakaria氏がELFの部品をSQLiteのテーブルに移す試作SELFを公開した。stripはDELETE、patchelfはUPDATEになり、binfmt_miscで登録すると起動する。

  14. NISTが売るピーナツバターは食品ではなく物差し 冷凍で届く基準物質

    米国立標準技術研究所(NIST)が、成分の認証値付きピーナツバター「SRM 2387」を標準物質として販売しています。食品分析の測定手順を検証する試料で、NISTはマイナス20°Cの冷凍保管を指定し、ドライアイスに載せて発送します。

  15. 幼児は3000万語、LLMは15兆トークン 子どもが勝てる理由はまだ分からない

    幼児は約1000万〜3000万語で文法的な文を話し始めます。MetaのLlama 3.1は事前学習で15兆トークンを読みました。この「データ効率ギャップ」に挑むBabyLMコンペと頭部カメラ研究を噛み砕きます。

  16. オプトアウトしても映り込みは学習される TwitchのAI訓練に集団訴訟

    Twitchの配信者がAmazonを集団訴訟で訴えました。配信を無断・無償でAI訓練に使ったとの主張です。オプトアウトしても他人の配信への映り込みは学習の対象に残り、収集がいつ始まったのかは運営側も答えられていません。

  17. 200億ドルで買った速さが量産に NvidiaがGroq 3 LPXを年内稼働

    Nvidiaが200億ドルで買収したGroqの技術が量産に入りました。SRAM 500MBを載せたチップを256個束ねたラックが毎秒3,400トークンを出し、クラウド事業者Nebiusで年内に稼働します。

  18. 若手だけ19%低い スタンフォードがAIの雇用影響を職種別に測った

    スタンフォード大学の研究チームが、AIの影響が大きい職種では22〜25歳の雇用が19%低いと報告しました。経済全体では差がほぼ無く、影響は若手の採用減に集中しています。物差しはADPの給与データとAnthropic Economic Indexです。

  19. 合成音声の9割を当てた技術者82人が ElevenLabsでは半分も見抜けない

    2019年・2022年・2024年の音声合成ツールをIT技術者82人に聞き比べさせた研究。全文合成のF1はRTVCとYourTTSの約90%からElevenLabsの48%に落ち、1文だけ差し替えた録音では9%まで下がりました。

  20. AIは秘密を言わずに漏らす 無害な作文から4桁のPINが82%復元された

    文脈に置いた秘密を、AIは直接聞かれれば拒否します。それでも普通の依頼への返答から、4桁のPINが82%の完全一致で復元されました。8つの商用モデルを調べた査読前の論文を噛み砕きます。

  21. 150回すべて通った ChatGPTがAI対策入りの量子の宿題を解いた

    AIを禁止せず、学生に回路の実行と結果の吟味を求めるQiskitの宿題を、ChatGPTに丸ごと渡した実験です。3つの課題を50セッションずつ試した計150回すべてで、成果物が自動採点を通りました。

  22. 広告のCO2は誰も直接測っていない 研究者が15本から測り方を5つ掘り出した

    ウェブ広告とトラッキングの電力を測る方法を、トロント大学の2人が15本の論文から5つに整理しました。標準はまだ無く、15本のどれもCO2を直接は測っていません。

  23. 低い声で落ち着くはずだった ロボットの声を35Hz下げても差は出なかった

    人同士なら低い声が緊張を下げます。オランダの子ども27人にロボットの声を35Hz下げて聞かせても、ストレスに差は出ませんでした。RO-MAN 2026 に採録された論文を読み解きます。

  24. 人が何も買わなくても経済は成長する 企業とロボットが互いに買い合う

    完全自動化への反論は「人が稼がないなら誰が買うのか」。arXiv の査読前の作業論文は、企業が所有するAIとロボットが互いの買い手になれば、人の消費がゼロでも経済は最大の速さで成長すると論じます。

  25. AIの答えは3年で似てきた 論文が68モデルの出力の多様性を測る

    2023年3月から2026年7月までに出た68モデルへ同じ課題を出し、答えどうしの距離を測った論文があります。距離は年を追って縮み、モデルの出力は互いに似てきていました。

  26. 電力網が違えば答えが変わる データセンターはPJMで移り韓国で待つ

    データセンターを柔軟に動かせば電力設備の投資を先送りできます。査読前の論文は、市場型の米PJMでは地域間の移動、炭素上限のある韓国では昼の太陽光への時間移動が効くと報告しています。

  27. 自分の宿題を自分で採点させない Robloxが年齢推定の監査に応じた経緯

    豪州の規制当局が、大人が子どもに接続申請を送れる状態と、誰にでも見える交友関係を検証で見つけました。Robloxは3か月以内の改修と、年齢推定技術への第三者監査を法的に約束しました。

  28. 正しい記憶で答えを間違える 5つのメモリ手法すべてが記憶なしに負けた

    内容が正しく、いまの質問にも関係している記憶が、AIの答えを悪くする。5つのメモリ手法すべてが記憶なしに負けたベンチマーク MemTrapBench を噛み砕きます。

  29. 有名な事実ほど消え残る AdaPop は人気度で消す力を変える

    有名な事実は消え残り、珍しい事実は消しすぎになります。AdaPop は Wikidata のリンク数で事実ごとに消す力を変え、言い換え質問での漏れを約5分の1に抑えたと報告する査読前論文を読み解きます。

  30. 読むだけの採点は10点以内 工場の制御コードは動かすと30点開く

    PLC は工場のラインや発電所を動かす制御装置です。AI が書いた PLC のコードを読むだけで採点すると4手法は10点以内に収まり、実機で走らせて実行トレースを比べると22.4から52.2に散りました。