必読 ★★★
I built non-autoregressive decision models with RL a year ago
Hacker News▲1137 ・ 💬281
ConvAI InnovationsのNandakishor Mukkunnoth氏が、2025年3月に強化学習で同じ発想の構造化判断モデル「Laya」を作り、論文・オープンウェイト・PyPIパッケージまで公開していたと主張。自身のベンチマークでは実行33msでJevの236〜276msより7.8倍速く、精度0.766対0.727、信頼度の較正も3倍良いとする。無償かつ重み公開である点も対比されている。論文も重みもデータセットも出さないまま「ブレイクスルー」として発表されたことへの異議という性格が強く、数字は自己申告なので追試待ちだが、今週の熱狂に冷や水をかける重要な一本。
If math is more than proof, we need to better celebrate the rest of it
Hacker News▲320 ・ 💬248
Terence Tao氏のブログに3Blue1Brownのグラント・サンダーソン氏が寄せたゲスト投稿。証明は本来の目的である「人間の理解を進めること」の代理指標にすぎず、機械が理解を伴わずに証明を出せる時代には、「どうやってそれを思いつくのか」に答える動機づけられた説明をこそ評価すべきだと説く。解説問題を研究問題と同じ扱いにする、教科書執筆をテニュア評価に含める、未解明の結果に絞った現代版ヒルベルト問題を作る、といった具体策まで踏み込んでいて、フィールズ賞受賞者の書簡から始まった議論のなかで最も建設的な提案になっている。
はてブ / Zenn🔖149 users
公開から数日で、解説・検証・道具が国内から立て続けに出てきた。図解ガイドが仕組みを絵で説明し、mizchi氏のjev-lintは命名やコメントが実装と食い違っていないかを高速に判定する用途を示し、uehaj氏のjev-semgrepは「意味で探すgrep」として全件走査を現実的な速度でやる。いずれも「判断だけを安く速く大量に」という性質を素直に活かした形で、上のLayaの異議と合わせて読むと、技術の位置づけと実用価値を切り分けて考えやすい。
はてブ🔖64 users
SalesforceのBenioff氏との対談での発言として報じられたもの。GPT-5.5が並の数学教授、5.6が世界水準の上位1〜2%相当で、コードネーム「Post-Astra」の社内モデルはその先だという位置づけ。ただしこの記事は他にもかなり刺激的な具体を並べており、そこは独立した裏取りが見当たらない。発言そのものの確認を含め、一次情報を待って判断したい類の話として挙げておく。今週の数学コミュニティの議論と直接つながる文脈ではある。
AI / LLM ★★
はてブ🔖111 users
テストの生成も実行もエージェントに寄せたとき、品質の判断そのものを誰が担うのかという問い。先週の「テストを生成するな、信頼を生成しろ」とも響き合う内容で、QA側の視点が入っているのが良い。
Zenn / はてブ👍28 ・ 🔖92 users
フックを使って挙動を差し替える方法のまとめ。AGENTS.md対応やスキルの棚卸しが話題になった直後で、設定の階層を整理し直すのに合わせて読みたい。
Hacker News▲200 ・ 💬85
モデルの重みが盗まれる経路と、それを前提にした防御を整理したサイト。Amodei氏が減速の条件に「重み流出の防止」を挙げていたのを、技術面から具体化した読み物として使える。
Hacker News▲190 ・ 💬81
長期の計画と即時の判断が同時に要る題材としてのRTS。SWE系のベンチマークが飽和気味に見えるなかで、別種の能力を測る試みとして面白い。
Show HN: CUA-S1 – A System One Model for Computer Use
Hacker News▲68 ・ 💬8
画面操作の次の一手を高速に選ぶことに絞ったモデル。Jevが提示した「判断だけのモデル」というカテゴリに、早速別の応用が乗ってきた形。
はてブ🔖76 users
バイブコーディングが一般ニュースの枠で扱われた。現場の受け止めとの温度差はあるにせよ、非エンジニアの上司や家族にこの話をするときの共通の足場になる。
開発・エンジニアリング ★★
はてブ🔖68 users
実行ロールの権限が広いまま放置された関数から、どこまで到達できるかを手順で示した資料。先日のBaseten乗っ取りやエージェントの内通者化の話と並べると、権限の棚卸しを後回しにできなくなる。
Tin: full-text search for Postgres
Hacker News▲201 ・ 💬76
先日のNekiに続くPostgres周りの新作。検索のためだけに別のミドルウェアを増やさずに済むなら、構成を一段簡単にできる。
What Zig felt like, coming from Rust
Hacker News▲176 ・ 💬218
安全性を型で縛る設計と、明示性で押し切る設計の対比。どちらが上という話ではなく、どこに認知の負荷を置くかの違いとして整理されていて読みやすい。
Btrfs/ZFS/bcachefs under workloads classic benchmarks skip
Hacker News▲93 ・ 💬79
スナップショットが積み上がった状態や断片化後の挙動など、実運用で効くところを測った比較。ファイルシステム選定の判断材料として珍しく実践的。
はてブ🔖60 users
ジョージア州の事例。電力に続いて水も争点になってきており、EPAの規制緩和方針とあわせると、立地の合意形成が今後の律速になりそう。
はてブ🔖99 users
日本語入力の歴史を辿る書籍の紹介。かな入力が主流にならなかった経緯は、入力方式の設計を考えるうえでも示唆が多い。東プレの分割キーボード「REALFORCE RS1」発表と同じ日に伸びたのが偶然ながら面白い。
そのほか ★
AI-generated posters don't have to be horrible
Hacker News▲1439 ・ 💬794
生成物の質が低いのは道具ではなく使い方の問題だ、という実例つきの主張。コメント欄は例によって賛否が激しいが、今週の「ドキュメントを読みたくない」議論と同じ構図が視覚表現でも起きている。
はてブ🔖91 users
静電容量無接点の分割モデルという、待っていた人には刺さる一台。価格と配列の情報が出そろうまでは様子見という声も多い。
Zenn
先週話題になった圧縮モデルを、実際に手元のノートで動かした記録。GPUを買い足さずにどこまでやれるかを知りたい人向け。