Recent posts
「基盤モデル作成のために資金投入を頑張ります」という方針は大いに褒められるべきで「基盤モデル作る企業は全員PFNに合流してね」という方針は大いに批判されるべき
制限ライセンス「こんにちは、伝播してきました」

nemotron 3 ultraのrlデータセットがどこから来ているのか調査してたんだけどすげえなこれ...

思った以上に人間観察会場と化してしまった。

「なぜLLMで数学の未解決問題が解けるのか」 に 「学習データに含まれていて、それを確率的に答えている」 と解説してる人、いろいろすごい
僕の知らないLLMだ > 事前学習データと合わせてクロールした情報を確率で選択して答える

@odashi_t 全然その通りだと思うけど そもそも事前学習データと合わせてクロールした情報を確率で選択して答えるのがLLM 意思持って会話したり計算したりしてるとでも思ってんの?
LLM as a Judgeで商用LLMを使って最終評価した時点で利用規約違反では問題

CodexとかClaudeにE2E(データの収集から評価)でLLMの学習を回させた場合は、オープンリソースのデータを食わせていたとしても競合モデル構築の利用規約に抵触するのだろうか。
研究成果が公開されているかどうかはものによりそうですが、研究成果よりも単純な試行錯誤や投入計算量による差が大きいと思います。技術自体は大学院生が分かる程度のものです。

割と「フロンティアLLMに組み込まれている技術はある程度研究成果として発表されており、それなりに後追い出来る」って認識を持ってて、それなりの試行錯誤は必要だけど、一回脱落すると終わり、みたいなものではないのでは?って気持ちでいる。
Claudeが作るスライド、端的に使い物にならないので、たたき台だけ書いてもらって全部書き直すというのをいつもやっている。来年くらいには解決してほしいが、よく考えると「ああいうスライド」をありがたがる界隈が存在しそうなので、解決しないかも?
機械学習界隈に目を付けられた(評価尺度に設定された)タスクは速やかに陳腐化するが、「数学上の未解決問題の解決」が評価尺度として認定されたので未解決問題が陳腐になるという現象が起こっている。何か月か前まではポケモンの操作だった。
これも誰かハマったことあるんだろうな的な問題だなあ…

Python クイズ Day4です! lambdaは何を覚えている? 解けた方は引用リポストなどで教えてください! 問題はスレッドに記載👇 #pycon #毎日投稿
オーケストレータの基部にそこそこ賢いLLMを配置し、推論性能と費用を報酬として分岐先(自己推論を含む)の選択を行う、というトレードオフ最適化の問題設定がある。うまくやれば単一モデルよりも高性能・低費用にできるので、これはこれで重要な技術である。

