0923 | 今週のテック速報:AI価格戦争とセキュリティ事故

||Download

Show notes

今週のテックニュースダイジェスト。新AIモデルの価格競争とセキュリティ事故、Apple広告やmacOSの変更、FoxPro復活やAMD RNGバグなど開発現場の話題、そしてワールドカップの不健康食品広告まで、幅広い話題をコンパクトに。

タイムライン

  • 00:00:04 オープニング
  • 00:00:39 AIモデルの価格戦争:Opus 5.5とGPT-6 Sol/Luna
  • 00:02:31 オープン化と新しいパラダイム:MiMoとJev、エージェント効率化
  • 00:04:57 AIが単独で課題を解く:Enigma解読とgzip LM実験
  • 00:06:46 セキュリティ事故:FBI侵害、ペンタゴン誤爆、Metaの鍵流出
  • 00:08:59 ウェブと認証のセキュリティ:WordPress RCE、SAML批判、VPN設計
  • 00:12:09 Appleの押し付け広告とOSの自由度
  • 00:13:40 開発ツールとレガシー復活:FoxScript、GeaStack、Drop
  • 00:15:58 ハードウェアの不思議:AMD RNGのゼロ欠如バグ
  • 00:17:08 放送と文化:W杯の有害広告、Bukowskiの8088
  • 00:18:54 クロージング

関連リンク

このエピソードは Bri によって制作されています。Bri は高度な AI 技術で、あなたが気にかけるフィードを聞くためのポッドキャストに変換します。お問い合わせは hi@bri.so まで。

Transcript

: こんにちは、葵です。

悠真: 悠真です。今日も過去24時間の技術ニュースを、コメント欄の議論を中心に深掘りしていく回です。

: 今回のテーマは、AIモデルの価格競争とセキュリティ事故、そしてOSベンダーの自由度が縮む話まで、だいたい「信頼とコスト」でつながっています。性能が上がって価格が下がるAI、一方で大組織の検証不足が招いた事故、そして自分の使うOSに選択肢が減っていく話。全部、誰をどこまで信頼できるか、という問題なんですよね。

悠真: じゃあ一番ホットな話題から。AnthropicのClaude Opus 5.5です。エージェンティックコーディングの新リーダーで、コンテキストは100万トークン、価格は入力$4、出力$20。Opus 5と比べるとタスクあたり半分くらい、トークン単価で40%安いという話。

: 一方OpenAIはGPT-6 SolとLunaを発表して、API価格を5.6から比べて50%削減。Solが$2/$10、Lunaが$0.10/$0.50。Lunaなんて入力10セントなので、桁が違う感覚ですよね。

悠真: コメント欄で盛り上がっていたのは二つの流れ。ひとつは「とうとう価格戦争が来た」という実感。40%、50%という下げ幅が一度のリリースで出るのは、同じ性能を維持したままという前提だからこそ意味があって、これは単なるディスカウントではなくコスト構造の変化だ、という指摘。

: もうひとつは「じゃあ何を選べばいいのか」の実務的な相談。タスクあたりでOpus 5.5がOpus 5の約半分という数字は、定額を書く側にとって一番大事な指標で、トークン単価だけ見るとSolの方が安い場合でも、実際のワークフローで必要な呼び出し回数やリトライまで含めると、総コストでどちらが得かは簡単に決められない、という声が多かったです。

悠真: そう、手作業で一発で終わるタスクと、エージェントに丸投げして何十往復もするタスクでは、勝つモデルが変わる。エージェンティックコーディングのリーダーという位置づけのOpus 5.5と、API大幅値下げのSol/Luna、どちらの強みを取るかで方針が割れていました。

: あと議論として残っていたのは「この下げが続くのか」ですね。性能維持のままコスト競争が続くなら大歓勝ですが、値下げが終わった後に品質がどうなるか、という疑問は誰も答えられなかった。これは今後も観察が続く点です。

悠真: そこから自然につながるのが、クローズドモデルが値下げ合戦をしている裏で、オープンモデルと、そもそもモデルの使い方を変えてしまう試みです。

: まずMiMo-V2.6-Pro。MoE方式で総パラメータ1T、うち活性は42B。トークン生成は毎秒125。しかもMITライセンスで、AAのインテリジェンスインデックスは46。

悠真: コメント欄ではMITライセンスな1Tクラスが出たこと自体に驚きが大きくて、「活性42Bなら自分でホストできそうか」という試算を始める人が続出していました。42Bって、ふつうの推論サーバー構成でギリギリ現実的なレンジだという話。

: 一方で「AA index 46という数字をどう読むか」で意見が割れました。フロンティアモデルと比べたら差は歴然だけど、値段ゼロ、データを外部に送らないという条件付きなら、46で十分な仕事は山ほどある、という立場と、それなら安いAPIモデルでよくない?という立場。実はこの値下げ戦争と、オープンモデルの立ち位置が同じ勝負をしているんですよね。閉じて高精度、開いて低コスト。

悠真: そしてもっと面白い方向性として、TypeSafeのJevというモデル。これ、普通のテキスト生成じゃなくて、選択肢、ブール値、スコアといった型で意思決定を絞るモデルで、確率がキャリブレーションされている。APIキーはリクエストごとの課金。

: ここでArcturus Labsの分析が参照されていて、「OpenAIならJevのような仕組みは真似して自分のモデルに統合できる。TypeSafeの本当の堀は学習データだ」という指摘。コメント欄でもこれが論点になっていて、「型で絞って確率を較正するというアイデア自体は複製可能なのか」という議論です。

悠真: 「複製可能」派は、決定論的な出力形式ならAPIで包めば済む話だ、と。「堀はデータ」派は、確率が較正されているというのは、どういう選択が現実に正しかったかを集めたデータの蓄積がないと作れない、つまりアイデアではなくデータ資産が本質だ、と。この二つはかなり白熱していました。

: unresolvedなのは、キャリブレーションされた確率が実運用でどう評価されるかですね。モデルが「この選択は72%の確度」と言ったとき、その72%が信頼できるかどうかは、使ってみないと分からない。ここはまだ答えが出ていない話です。

悠真: さて、モデルが賢くなって自律的に仕事をする、という流れで、その実例が二つ。一つは結構歴史的な話です。

: GPT-6 Astraが、2005年以降解読されていなかったEnigmaのメッセージ、MVUEHを、単独で解読しました。cribとしてROSENOWを使い、しかも解読に使うツールをモデル自身が書いた、という話。

悠真: コメント欄で注目されていたのは、 criboの選択です。Enigma解読では crib の当たりが命なので、「自分で crib を選んで、自分でツールを書いて、実行して解にたどり着く」という一連の流れが人間の介入なしで完結したこと。これがエージェントハーネスの進歩の指標だ、という声。

: あとでまた出てくるのですが、Unreal Agentという、ツール呼び出しを非同期にするハーネスの話があって、そちらはCodexと比べ40%のコスト削減、品質は据え置きという報告です。つまり「エージェントが自分でツールを書く」と「ハーネスが効率化する」という、同じ方向を指す二つの進歩が同時に入ってきた。エージェントの自律性と経済性が両方上がってきている、と読めます。

悠真: もう一つはもっと基礎的な実験で、gzipをbeam searchで言語モデル化してみたら、圧縮率がテキストの性質を部分的に再現できた、という研究。コメント欄では「圧縮と予測は裏返しだという直感は昔からあったけど、beam searchで実際にそれを測定できるの面白い」という感想が主流でした。

: ただし「部分的に」が大事で、これが本物のLMの代わりになるほどではない、という点ではほぼ一致。見どころは「小さな実験でも圧縮率を予測スコアとして使える」可能性です。モデルが巨大化する一方の今、圧縮の観点から言語モデルの性質を見直すアプローチが残っているのは面白い、と。

悠真: 能力が上がるほど、事故ったときの規模も大きくなる。ここから、ちょっと重い話題に入ります。大組織のセキュリティ事故が三日連続のような密度で来ています。

: まず一番大きいのは、ハッカーグループShinyHuntersの主張で、PeopleSoftのゼロデイを使ってFBIを侵害したというもの。全職員のデータ、2〜3TB、しかも採用サイトを改ざんしたとまで主張しています。

悠真: これ、あくまでグループ側の主張という点は注意が必要ですが、コメント欄の関心は「主張が本当かどうか」より「PeopleSoftをまだ使っているのか、ゼロデイがどこから来たのか」に向かっていました。レガシーなエンタープライズシステムが大組織の足元を突く、という構図は、この後の話ともつながります。

: もっと暗いのが、フランス語の話になりますが、Pentagonが、イランの学校へのミサイル誤爆の原因を「AIへの過度な信頼」と判断したという報告です。

悠真: これはコメント欄の空気が一番重かった。AIの判断をどこまで検証なしに受け入れるかという問題は、エンジニアリングの問題ではなく、組織と手順の問題だ、という見方が多数でした。「AIが間違える」のではなく「人間が確認を省いた」のが原因だ、というコメントに同意が多い一方で、「確認を省かせる環境をAIが作ってしまった」のだからAI側の責任もゼロではない、という反論もあって、この二つの立場は決着しませんでした。

: そしてMetaのMuse。これは技術的には単純な事故ですが、象徴的な事故です。ファイルシステムのアーカイブ要求が誤ってGoogle Driveに送られ、解凍すると6.8GB、そこにSSH鍵が入っていた。しかもバグバウンティの判定は「Not Applicable」。

悠真: この「Not Applicable」が一番注目されました。SSH鍵が外部ストレージに流れて、しかもそれを報告しても報奨対象にすらならない、という運用が示されたことに対して、コメント欄は強い反応でした。大組織が検証を怠った結果、鍵という秘密がそのまま漏れる、という構造が三つとも共通している、という指摘がまとめるような形で出ていました。FBIのゼロデイ、Pentagonの過信、Metaの鍵流出。どれも「確認手続き」を省いた結果です。

: 大手企業や政府機関のセキュリティがこうなら、日常のウェブも自分で守るしかない、という流れで、ウェブと認証の話題に移ります。

悠真: まずWordPress。get_page_templateという関数で、認証不要のパストラバーサルが発見され、条件付きでRCEに至る。CVSSは9.2。しかも修正は4.7までのバージョンにバックポートされています。

: コメント欄で強調されていたのは「認証不要」です。パストラバーサル自体は古典的な脆弱性ですが、ログインしていない攻撃者が触れる箇所にあると、攻撃のハードルが極端に下がる。条件付きRCEという点がずるくて、環境によってはWebサーバーがまるごと取られる。WPのテーマやプラグインを更新していないサイトは、実質的に公開の踏み台候補だという厳しい指摘もありました。

悠真: そのすぐ隣に、Trail of Bitsの主張が来ています。SAMLは「悪いデザインのフラクタル」。XML、そしてエンベロープ署名の問題があり、OIDCへの移行を勧めている。

: この「フラクタル」という言い方がコメント欄で支持されました。SAMLの問題は一箇所のバグではなく、設計全体の隅々にまでバッドプラクティスがネストしている、という意味ですね。XMLのパーサーの複雑さ、署名がどこに包まれるかの曖昧さ、どれを直してもまた下から別の問題が出てくる。OIDCへの移行を勧めるのは、修繕より引っ越しが安い、という判断です。

悠真: ただし現実のコメントでは「SAMLで動いている大企業のSSOを置き換えるコストが現実的か」という質問が出て、ここは決着していません。「新規なら絶対OIDC、既存は計画的に移行」というのが現場の立ち位置っぽいです。

: そして、自分の通信を自分で守る側の設計として、ObscuraというVPN。no logsが「設計として」成り立つようになっていて、二段のリレー構成、出口はMullvad、アカウントは番号がランダムに発行される、月8ドル。

悠真: コメント欄で好評だったのは「no logsを謳うのではなく、ログがそもそも書けない構造にする」という発想の順番です。多くのVPNはポリシーでno logsを約束しますが、Obscuraはランダムな口座番号と二段リレーで、そもそも識別情報が蓄積しない設計。ポリシーによる保証と、構造による保証の違い、という話は、さっきのPentagonの話とつながりますね。「人やポリシーに頼らず構造で守る」という流れです。

: そのつながりで、もう一つ、認証とプライバシーの話題。Discordが年齢グループの推定を始めた話です。アカウントの各種シグナルから年齢層を推定して、90%以上のユーザーは対象外。そしてIDやセルフィーなしの検証が可能なパスが用意されている。

悠真: コメント欄では「IDやセルフィーを要求せずに済むパスがあるなら、これでよかった」という受け止めが多かったです。年齢認証をサービスに強制する流れの中で、シグナルによる推定+代替パスという設計は、プライバシーを尊重しながら規制に応える現実解の一つだ、と。ただ「推定に外れた人はどうなるのか」という疑問は残っていて、ここはまだ観察が必要な点です。

: さて、自分のデータとOSを自分で管理するという流れで、次の話題はAppleです。これ、コメント欄はかなり荒れていました。

悠真: まずmacOS 27。Apple Intelligenceを無効化するスイッチが削除されました。しかも、作者が「いいえ」を選択した設定が無視されて、22.28GBも占有されるという実報告。

: そしてiOS。App Storeに消せない常設の「広告」が追加され、検索には全画面広告が表示されるようになった。

悠真: この二つをコメント欄がどう読んだかというと、「OSがプラットフォーム化して、ユーザーの選択が減っている」という問題意識に集約されました。OSを買ったつもりが、実はOS上の広告枠を買わされた、と。しかも拒否設定が無視されるのは、設定UI自体が嘘をついていることになるので、信頼の問題として深刻だ、という指摘。

: そこで、逆張りの手も来ています。GrapheneOSが「2027年にプリインストールされた端末が入手できる可能性が高い」と発表。ただし最初のローンチではない、と。

悠真: これがコメント欄で一番希望が持てた話題でした。デブロビングされた端末が量販店で買える未来が、ようやく具体的に見えてきた、と。ただし「可能性が高い」であって確定ではない点、「初期ローンチには含まれない」点は、まだ待ちの状態だという受け止め。Appleが設定を握りつぶす方向に進む一方で、選択肢を取り戻す動きも始まっている、という対比で語られていました。

: ユーザーがOSから自由を取り戻そうとする動きの次は、開発者がツールで自由を確保する話です。ここはレガシーの復活も含めて面白い話が三つ連続です。

悠真: まずFoxScript。Visual FoxPro 9は2007年で開発が終了したのですが、それを64-bitのRust/wasmランタイムで蘇らせようという試み。しかも2GB超のテーブルに対応、そして32-bitの.fllライブラリまでサポートしている。

: コメント欄で一番の驚きは「32-bitの.fllをサポートする」という部分でした。VFPの現場って、開発が止まってから18年経っているのに、まだ動いているシステムが相当数あるという現実の話。それが64-bit化とwasm化で動くなら、移行コストが劇的に下がる、と。レガシーとは「捨てるべきもの」ではなく「まだ価値があるが土台が腐ったもの」で、土台だけ新しくするアプローチが実用的だ、という声が主流でした。

悠真: 次にGeaStack。TypeScriptをJSエンジンなしでネイティブC++にコンパイルする。しかもレンダリングがCSSとJSXのままネイティブで、ESP32のようなマイコンでも動く。

: コメント欄は二択に分かれました。「JSXとCSSのままマイコンで動くのは夢が広がる」という派と、「TypeScriptの型とJSの動的な性質を全部ネイティブに落とすのは、ランタイムの複雑さがどこに逃げるのか心配」という派。特に組み込みではメモリとリアルタイム性の制約が厳しいので、本当に実用になるかは、ベンチマークとメモリ使用量の公開を待つ段階、というのが冷静な見方でした。

悠真: 最後はDrop。これはLinuxのrootless sandboxで、virtualenvからインスピレーションを得ています。namespaceベースで、オプションでgVisorも使える。環境ごとに使い捨てのhome directoryを用意する。

: これはコメント欄での反応が一つにまとまっていて、「コンテナより軽く、virtualenvより安全な、ちょうどいい粒度」という評価。使い捨てhome dirの発想は、依存関係で汚染される ~/.config や ~/.cache の問題を一気に解決する、と。gVisorをオプションにしているのも賢くて、軽さと分離のトレードオフをユーザーに選ばせている、という点が支持されていました。

悠真: 開発ツールの話が続いたので、低レイヤーに降ります。この最後の話題は、かなりニッチですが、放っておけないバグです。

: AMDのハードウェアRNGに、16ビットと32ビットモードで「ゼロを一切生成しない」というバグが発見されました。Intelでは正常に動く、という対比まで示されています。

悠真: 「ゼロが出ないRNG」というのがコメント欄で遊び心を刺激したようで、「乱数が偏る」という一言で片付けず、具体的に「16ビット空間で65,536通りあるはずが、ゼロだけが永遠に出ない」という事実の不気味さをみんな楽しんでいました。

: ただ、笑い話ではなく、これは暗号利用の信頼に直結するバグです。ハードウェアRNGをキー生成やnonce生成に使っているコードでは、たとえ一つの値が出ないだけでも、分布の歪みとして理論的には攻撃面になります。

悠真: この話はまだ始まったばかりで、今後の焦点はマイクロコード更新と、ユーザーが自分で検証できるかどうか。ハードウェアRNGをブラックボックスのまま信頼するのではなく、簡易な統計テストを定期的に回すような習慣が生まれるか、というところが注目点です。

: ラストは二つの話。一つは規制の議論になり得る調査、もう一つは文化史の楽しい話です。

悠真: まずBristol大学の調査。ワールドカップの放送で、有害なブランド表示が93,000回を超えて検出された。うち7割が不健康食品で、生放送の約4分の1に表示があった、という数字です。

: これがコメント欄で重視されたのは「規制の根拠になり得る実数値」という点です。抽象的な「テレビの広告は健康に悪い」という主張ではなく、93,000回、7割が不健康食品、生放送の4分の1という三つの数字が揃うと、法規制や自己規制の議論に直接入力できる。特に子どもの視聴が多い大会である点が、この種の調査でいつも重要な論点になります。

悠真: ただ、調査そのものへの批判もあって、「ブランド表示を有害と数える基準の妥当性」を疑問視する声。看板が背景に映っただけでもカウントするのか、意図的な露出と偶然の露出をどう区別するのか。この点は調査の原典を読むまで判断できません。

: 最後の話は軽くて心温まる話です。Bukowski、チャールズ・ブコウスキーが、Intelの8088について詩を書いていたという話。1985年頃の作品で、しかも当時のコンピューティングについて事実に忠実なんだそうです。

悠真: コメント欄はほっこりしていました。「ブコウスキーの詩に8088がある日が来るとは」「しかも技術的に正確」と。ブルータルで酒と競馬の詩人だというイメージが強い人ですが、実はマイクロプロセッサも題材にしていた。1985年当時のコンピューティングの空気が、文学作品の中に事実として残っているのは、文化史的に貴重な記録だという声もありました。

: 技術の記録って、新聞記事だけじゃなくて、詩にも残るんですよね。だからこのエピソード、エンディングにぴったりだと思います。

悠真: そうですね。今日の話を通して見ると、モデルは賢くなり、安くなり、自律的に仕事をするようになった。その一方で、FBIの侵害、Pentagonの誤爆、Metaの鍵流出、AMDのRNGバグ、Appleの設定握りつぶし、と「確認と検証と選択」を省いてしまった事故と後退がずらっと並んでいたと思います。

: 技術が上に行けば行くほど、土台のチェックを怠った場合の代償が大きくなる。今日の全部の話が、その一点に収束するような1日でした。

悠真: それでは、また明日。

: お疲れさまでした。