Back to people
@odashi_t
O
@odashi_t

研究者の真似事をしています。

25KFollowers199Following10KPostsView on X

Recent posts

ロボットオリンピックの奇行種、腰の関節を犠牲にして走ってそうなので、走り終わった後再起不能になってもいいならという条件付きで採用できそう

mistranslation

Photo 1

これでカセットボンベ1缶使い切ったんですが、作業してから先に鉄たわしか何かで一通り汚れを落としてから焼けばいいことに気づいた。

@odashi_t
O
Odashi@odashi_t

だいぶ汚れが溜まっていた中華鍋を焼き切っていた。

昨日の地震関係の投稿を今流すX、大変迷惑

Metaのライブラリで昨今お世話になっているものといえばReactとかzstdとか

マンションの管理組合業務。

offload前提のチューニングしていないモデルでそんな速度出るとは思えないんだがどうなんだろうね

だいぶ汚れが溜まっていた中華鍋を焼き切っていた。

EMNLP 1 main, 1 rejectでした。よろしくお願いします。

特定のLLMで生成されたことがwatermarkされ、ユーザ側でそれが確認できるようになると、そのLLM(ないし提供事業者)の弱点を突いた攻撃というのが可能になるので、どのモデルかという情報はwatermarkに明示しない方がよいのでは

公式GGUFの性能がおかしい場合はLLM-jpで面倒を見るべきだと思いますが、私家版GGUFで性能が出なくても「知らんがな」なのでそこはご承知おき願いたい

なんというか「このデータセット使ってチューニングすれば普通に性能出る(出た)」という実験結果は無数にあるが、全部に「ライセンス無視した場合」という条件が付くという感じ

内部的にはAIME24~26で60~70%くらい出るモデルが既にありますが、使っているデータセット(有名なやつ)のライセンス問題でOSAIモデルとしては提供できないです。傍流の実験モデルとしてはそのうち出すかもしれません。

@alfredplpl
あ
あるふ@alfredplpl

llm-jp/llm-jp-4-33b-thinking、こうやって見ると、エージェント能力だけではなく、STEMの能力も学習させてないので、課題がまだまだ山積しているという気持ちになる。もっと税金を投下したほうがいいのでは?

「オープンな国産モデル」に33Bパラメータの新バージョン 国立情報学研究所 - ITmedia AI+ https://www.itmedia.co.jp/aiplus/article/2608/19/2000000626/

こいつで遊んでいた。

Photo 1

エージェント向けの学習はほとんど全く行っていない(現状そこにリソースを入れていない)ので、もし動くなら普通に驚く

@alfredplpl
あ
あるふ@alfredplpl

llm-jp/llm-jp-4-33b-thinking、おそらく基本機能はかなり高くなっていて、十分な性能が出ている。ただ、事後学習が不足していて、エージェント機能が厳しいかも。

長期学習を回してるのは主に自分ですが、以前は夜中にエラーで学習器が死んで叩き起こされる感じでした。最近は復旧やエラー分析は自動化してしまったので以前よりは楽

@sidodtv
内
内田勉 個人でLLM開発中@sidodtv

llm-jp-4 メッチャ頑張ってる! 半年以上も計算させっぱなしで良く不安にならないな〜 > 計算資源の不足もあって去年の秋から訓練し始めてようやく公開です…