きしだのHatena

フィード

記事のアイキャッチ画像
目にみえる作業を電子化しても使えるシステムにならないので業務やってる人がAI使ってシステム作っても使い物にならないがち
はてなブックマークアイコン 10
きしだのHatena
AIでだれでもちょっとしたプログラムを作れるようになっているので、業務をやってる人がシステム開発したけども全然使えない、みたいな話を聞くようになりました。 それで「業務をしっててもシステムは作れないのか」みたいな話が出ますが、システムを作れるほど「業務をしってる」という人はなかなかいなくて、多くは業務の作業を知っているだけです。 自分の担当外はよく知らなかったり、なぜその作業手順になってるか、それを変えるとどういう影響が出るかとかまでは、業務をまわしているだけではわかりにくいと思います。 業務全体のワークフローや状態遷移、データ構造をわかっているわけではないので、目に見える作業のUIを作って電…
16時間前
記事のアイキャッチ画像
DeepSeek-V4.1-FlashがEncoder-Decoderと呼んでいる後半層KV近似をQwen3で試してPrefill時間を半分にする
きしだのHatena
DeepSeek-V4.1-Flashの仕組みをみて思ったんだけど、Encoder-Decoderモデルということになっていますが、実際のところはプレフィル時に後半の層のKVを近似モデルで埋める仕組みになってます。 DeepSeek-V4.1-Flashのアーキテクチャの雑な理解 - きしだのHatena なので、近似モデルさえ用意すれば既存のモデルにも適用できてPrefillの時間が半分になるんではないかということで、試したらちゃんと動きました。 DeepSeek-V4.1-Flashの場合は近似モデル前提で学習しているため、EncoderとDecoderの役割が明確になっているだろうからE…
17日前
記事のアイキャッチ画像
AIで手軽に3Dを扱えることは、案外多くの仕事に影響するかも
きしだのHatena
GPT-6 Astraが3Dモデルをうまく扱えることで、かっこいい3Dをつくったりゲームを作ったりハエの操作を動画化する人がたくさんいます。 これ、エンタテイメント関連なので自分たちの業務には関係ないって思うかもしれませんが、3Dを扱えるということは案外多くの業務で役に立つかもしれません。 というのも、多くの業務が現実と接続するわけで、そして現実は3Dなので、AIが3Dを扱えれば現実を扱いやすくなり、業務にもいかせる場所があるはず。 ところでこの博多駅、Opusだと、写真を渡せばモデリング、とまではいきませんでしたが、博多駅ビルやKITTE博多のサイズは写真の画角から妥当なサイズにモデリングし…
17日前
記事のアイキャッチ画像
DeepSeek-V4.1-Flashのアーキテクチャの雑な理解
きしだのHatena
DeepSeek-V4.1-Flashが出てて、V4の追加学習かと思ったら新しいアーキテクチャで、それがアテンションの工夫が変わりましたよってだけじゃなく全体の構成も他のモデルと違うので、違うところをまとめておく。 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf 大きく違うのは、エンコーダー ・デコーダーモデルであるということ。 左のエンコーダー側は最初の2層がスライディングウィンドウアテンションで残りがスパースアテンション。右側のデコーダーは全部スパース…
17日前
記事のアイキャッチ画像
ローカルLLM+Blenderでの3DモデリングをGLM、Qwen、DeepSeekで試す
きしだのHatena
Astraの登場でBlenderでの3Dモデリングが話題になっていますが、ローカルLLMでどのくらい3Dモデリングができるのか、GLM-5.3-Flash、Qwen3.8-Flash-Next、Qwen3.8-27B、DeepSeek-V4-Flash-Vision-Expの4つのモデルで試してみました。 帆船とは別に、SF戦闘機画像をわたしたものも作ってもらっています。 画像を渡してQwen3.8-27Bに3Dゲームを作らせるととてもいい - きしだのHatena 元々のQwen-Imageでの画像はつじつまがあっていないので、Geminiさんに3面図を作ってもらっています。 Opusさんが…
18日前
記事のアイキャッチ画像
いま起きているのはプロダクトの巨大化、サイクルの短期化、高頻度化。AI対策ではなくプロセス変化の対策を考える必要がある
きしだのHatena
いま起きているのは成果物の爆発でありサイクルの短期高頻度化。AI対策ではなくプロセス変化の対策を考えないといけない。AIに対してどうこうではない。 という話をしていたのでまとめ。 AIによって作業がすぐに終わるようになって、サイクルが超短期にまわるようになって回転速度が速くなり、プロダクトの成長が速くなり、プロダクト自体の数も増えてきた。そこで変化するプロセスに注目するべきで、AIは道具でしかないので、AIをどうするかって観点だと少し道がそれたり局所最適になるんじゃないかと。 つまり、例えば「AIが書いたPRが読めない、どうするか」ではなく「プロダクトの成長速度が速くて細かいところまで見れない…
1ヶ月前
記事のアイキャッチ画像
Qwen3.8-Flash-Next(125B-A6B+51B)を試す
きしだのHatena
Qwen3.8-Flash-Nextという新しいアーキテクチャのモデルが出ていました。 Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency 変なアーキテクチャになってて、基本的に125B-A6BのMoEモデルなんだけど、51Bのルックアップテーブルをもってて、2層目は3-gramでこのテーブルを引きます。 アクティブが6Bと少ないからか、まだ実装がこなれてないためかわからないけど、ちょっと不安定な挙動がありました。でも、できるものは なかなかすごい。 今回はデモっぽいものを作るところまでで、もう少しさ…
1ヶ月前
記事のアイキャッチ画像
画像を渡してQwen3.8-27Bに3Dゲームを作らせるととてもいい
きしだのHatena
Qwen3.8-27Bは画像に対応していて、画像どおりに3Dモデルを組むのも結構うまいので、画像を与えて3Dゲームを作らせてみました。 できる範囲で、かなり忠実に作ってくれています。一方、忠実に作りすぎるので、余計な表現があっても再現してしまうのと、Qwen3.8-27Bがもってる表現力に制約をかけてしまうことがあります。 画像なしでもここまで作ってくれています。 テキストのプロンプトのときと同様、モデルの能力を制限してしまわないよう、必要な情報を過不足なく適切に与える必要がありそうです。 そのためには、モデルを試しておいてどの程度の能力があるのか見ておくのは大切そう。 ソフトウェアデザイン …
1ヶ月前
記事のアイキャッチ画像
Qwen3.8-27Bのタスク完遂力がすごい。賢さではなく作業手順のよさで完成に導く
きしだのHatena
Qwen3.8-27B、構文エラーをボロボロ出すんで、ほんとにコード実装できるのか疑問だったけど、Qwen3実行エンジンを修正指示なく組み上げました。 たまに止まってたので「続けて」を入れたくらい。これはシステムトークンの扱いを考えるときにホンモノの<|im_end|>などを出力してしまうから。それでも、2-3回だったので、かなりスムーズ。 あとプロンプトで外部ライブラリなしを指定してたのにライブラリ使おうとしてたので「外部ライブラリ使うな」って言ったりjinjaエンジンを実装しようとしてたのを止めたくらいか。 24万トークン9時間。 いま手持ちの性能評価タスクで一番難しいのがQwen3実行エ…
1ヶ月前
記事のアイキャッチ画像
Qwen3.8-27Bは3Dモデリングがすごい
きしだのHatena
Qwen3.8-27Bはいろいろなアプリケーションを学習していますが、3Dモデリングやその操作もかなり学習してる気配があったので、いろいろ試してみました。 かなり色々なものを学習しているようです。また、音をつけることも学習してるようで、すべて音がついています。 ただ、ほぼ全てで単純な変数定義ミスやカッコの対応モレなど、ケアレスミスと言えるようなミスをいくつか出していました。この実装精度の悪さはちょっと気になるところ。 ※追記 画像を与えて作らせるのも楽しい ソフトウェアエンジニアリングの基礎 ―コーダーからエンジニアになるための実践ガイド作者:Nathaniel Schutta,Dan Veg…
1ヶ月前
記事のアイキャッチ画像
Qwen3.8-27Bを16GB VRAMで動かすならIQ3_XSS
きしだのHatena
UnslothさんのIQ3_XXSくらいまではサイズ削減に対してあまり性能が落ちず16GBで使うのにちょうどいいという話があるのでRTX 4060 Ti 16GBで試してみました。 それでもトークンには制限があるので、KVをQ8_0にしつつ、35000トークン程度でロードしてReasoning offで最初を作成、MTPをオフにしてロードしなおして50000トークン確保しつつReasoning onで修正・改修というのがよさそうです。 ソフトウェアエンジニアリングの基礎 ―コーダーからエンジニアになるための実践ガイド作者:Nathaniel Schutta,Dan VegaオライリージャパンA…
1ヶ月前
記事のアイキャッチ画像
Qwen3.8-27Bは最高の検討使。検討に検討を重ね検討を加速し成果物がない
きしだのHatena
Qwen3.8-27Bが出てました。 https://huggingface.co/Qwen/Qwen3.8-27B 確かに賢い。でも、ベンチマークの3.6からの劇的な向上はThinkingの長さで捻り出してると思います。しかしそうするとエージェントではThinkingが長すぎて成果物が出てこない・・・ チャットでワンショットで「〜をつくって」ではかなりいいものを作ってくれます。 でも、エージェントでもThinkingでコードの検討をして、検討に検討を重ね、成果物が出てこない。 そしてエージェントでちゃんと動くようThinkingを調整するとベンチスコアも3.6からちょっと向上くらいに落ち着く…
1ヶ月前
記事のアイキャッチ画像
メモリより大きいモデルを動かせるSSDストリーミングでQwen3.8-2.4T-A95Bの1Bit量子化(384GB)を128GBメモリで動かす
きしだのHatena
Qwen3.8-2.4T-A95Bが出てたけど試せない、という人が多いですね。一番小さいUnslothさんのところのQ1_0でも384GBで、現実的にMac Studio 512GBくらいしか動かせるマシンがありません。 ただ、実際に動くときに必要なのは95Bパラメータ分、1bit量子化なら20GBのメモリがあればどうにか動かせるはず。 そして128GBマシンを持つ人なら割といる。 ということで、MoEのexpertを必要なものだけSSDから読み込むSSDストリーミングを実装したQwen3.xエンジンを作ってたので、これを使うと128GBメモリのマシンでもQ1_0が動かせると思います。 元々は…
1ヶ月前
記事のアイキャッチ画像
Qwen3.8-2.4T-A95Bの1bit量子化版を試す。さすがに1bit量子化は劣化が激しそう
きしだのHatena
Qwen3.8-2.4T-A95Bが出ていたので、Unslothさんの1bit量子化版を試します。 397GBでMac Studio 512GBに余裕で乗りますね。 ということでいろいろ動かそうと思ったけど、やはり1bit量子化だとかなり性能劣化してそうな感じでした。 動いてえらい枠。 このスレッドで過程をまとめてます。 ブラウザで動かすLLM実装入門 Google Colaboratoryで実践するLLM・RAG・ファインチューニング作者:中西崇文インプレスAmazon ビルドと実行 今回はUnslothさんのUD_Q1_0を使います。 https://huggingface.co/unsl…
1ヶ月前
記事のアイキャッチ画像
NVIDIAのNemotron-3.5-Lightning 30B-A3Bを試す。実用には足りないけど「オープンソース」でもここまでできる
きしだのHatena
NVIDIAから出たNemotron 3.5 Lightningを試します。 NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents | NVIDIA Technical Blog サイズは30B-A3BでMamba 2ベースの線形アテンション採用モデルです。ライセンスはOpenMDW-1.1。 Nemotron 3 Nanoをエージェント対応にファインチューンしたものという感じ。 Nemotron 3 Superを試す。コードは堅実に書ける…
2ヶ月前
記事のアイキャッチ画像
Metaから出たMuse Glimmer 30Bを試す。言うこと聞かないのを我慢できれば使える
きしだのHatena
MetaからMuse Glimmer 30Bというモデルが出ていました。 Introducing Muse Glimmer: An Open Agentic Model That Runs on Your Device | Meta AI Research マルチモーダルなDenseモデルです。 ベンチマークで、SWE-Bench ProがQwen3.6-27Bよりちょい上、Verifiedがちょい下というスコアだったので期待しつつ。 こちらで過程をまとめてます。 コードはそこそこ書けるものの、Qwen3.6-27Bにはぜんぜん及ばない感じ。Gemma 4よりは書ける。 言うことは聞かないし、…
2ヶ月前
記事のアイキャッチ画像
JavaでIntegerやLong、LocalDateが==で比較できるようになる日
きしだのHatena
Java 28ではPreviewとしてJEP 401: Value Objects(Preview)が導入されます。 https://openjdk.org/jeps/401 で、Value Objectsってなんじゃ、となるわけですが、雑にいうとIntegerやLongなどラップクラスのオブジェクトやLocalDateなどdate timeのオブジェクトが==で比較できるようになります。 JDK 28のEarly Access Build 10から--enable-previewをつけて利用可能です。 https://jdk.java.net/28/ つまりこう。 jdk-28-ea10>b…
2ヶ月前
記事のアイキャッチ画像
韓国UpStageのSolar-Open2-250Bを試す
きしだのHatena
韓国UpStageの250B-A15Bのモデル、Solar-Open2-250Bを試します。 ライセンスはUpstage Solar Licenseで、Apache-2.0をベースに、派生モデルへのSolar提示を求めるライセンスです。 どうも難しいタスクで繰り返しが発生しそうな気配なので、他にいいモデルがあることを考えると使う候補にするのは難しそう。 ただ、韓国でソブリンAIとしてこのレベルのモデルがあるのはいいですね。 GGUFの実行 今回はこちらのQ6_Kを使います。 https://huggingface.co/prometheusAIR/Solar-Open2-250B-GGUF l…
2ヶ月前
記事のアイキャッチ画像
Step-3.7-Flash 198B-A11Bを試す。素直で扱いやすい。
きしだのHatena
128GBメモリのマシンで動かすのに最適サイズのStep-3.7-Flashを試します。 StepFunは日本ではあまり目立ってないけどZ.aiやMoonshotやMiniMaxと並んでSix AI Tigersに数えられている会社です。 音楽生成のAceStepのStepのほう担当。AceはAce Studio。 ちなみにSix AI Tigersはベンチャーキャピタル支援の企業ということなので、DeepSeekは含まれてません。 llama.cppではすでにMTP対応も含めサポートされています。DGX SparkでMTPを使うとかなり速くなる模様。 基本的なコードはなんなく動かすし、ここで…
2ヶ月前
記事のアイキャッチ画像
Laguna-S-2.1(118B-A8B)を試す。中国モデルを使えないなら有用。
きしだのHatena
Poolsideというアメリカ拠点の企業が出した118B-A8BのLLM、Laguna-S-2.1を試してみます。 llama.cppではb10173で対応してるので、LM Studioでも動くはず。 https://github.com/ggml-org/llama.cpp/releases/tag/b10173 知識がかなり怪しくてコーディング全振り感あるけど、エージェント動作はかなりしっかりしてます。知識をちゃんと与えてやれば、それなりにはコード書けると思います。 Inklingと同じく、中国系モデルが使えないなら貴重、という感じです。Ling-3.0-Flashがちゃんと動けばそちらの…
2ヶ月前
記事のアイキャッチ画像
Ling-3.0-Flashを試したかったけどローカルでうまく動かない
きしだのHatena
Ant Lingというところから、124B-A5.1BのLing-3.0-Flashというのが出ていたので試そうと思ったけどllama.cppでもmlxでも出力が変なのでOpenRouterで試しました。 過程はこちらのサブスク投稿でまとめてます。 どうにもローカルでうまく動かなかったので、OpenRouterでfreeで使えたのでこちらを試しています。 ※8/9追記 終わってた llama.cppで使う場合 llama.cppでの対応はこちらですがまだマージされてません。 BailingMoE3 Support by aetherbird · Pull Request #26608 · gg…
2ヶ月前
記事のアイキャッチ画像
TencentのHy3(295B-A21B)が400B以下のモデルの中で最強だと思う
きしだのHatena
いまサイズの割にパフォーマンスがよくて400B以下で最強と思っているモデルが、TencentのHy3です。 コーディングエージェントにはアクティブ20Bが必要と思っていて、知識も300Bくらい欲しいと思っているのだけど、Hy3の295B-A21Bというのがちょうどそのサイズです。 いつものUnslothさんからは量子化がでていないので、同じく性能の高い量子化を提供してるBartowskiさんのモデルを使います。 bartowski/Hy3-GGUF · Hugging Face コードちゃんと書けるし、無駄なトークンを使わないし、指示に従うし、素直で使いやすいモデルという印象です。 表現力は弱…
2ヶ月前
記事のアイキャッチ画像
ローカルLLMはパソコン買ったら動くのが当たり前になるので、要不要ではなく、いつ使うか、どう使うかの問題
きしだのHatena
DeepSeek-V4-Flash-0731のベンチマークスコアが派手だったことで、ローカルLLMへの注目が一段と高まりましたね。 サイズ5倍のモデルを越える性能とかで、もうローカルLLMでいいんじゃないか、とか。まあ実際に使うとサイズなりよりちょっと弱いくらいの性能なんだけど、期待感が高まった。 で、そんな中で「LLMに投資しても元が取れんのだからおとなしくサービス型モデルを使っておけ」みたいな話もちらほら流れてきます。 けど、最近は、それなりのパソコンを買ったら当たり前にLLMがバンドルされて動くという世界になりつつあります。 パソコン買ったらLLMがついてくる 例えば、HP製の日本向けP…
2ヶ月前
記事のアイキャッチ画像
Kimi K3をおうちのMac Studioたちでllama.cppの分散推論で動かす
きしだのHatena
Kimi K3を動かすためにMac Studio 512GBをもう一台 借りてきたので、試してみました。 今回はllama.cppでUnslothさんのところのQ2_K_XLを動かします。 速度は4.3tok/secと遅いけど、なんか外で嫌なことがあっても「うちではKimi K3が動いてるんだぜ」でがんばれる気持ち。 ただ、llama.cppの分散推論がパイプライン並列で速度が出ないので、後日テンソル並列で動かせるmlx-lmで試していろいろ動かそうと思います。 今回はPAGODA GARDENだけ。 こちらのサブスクのほうに動かす過程をまとめてます。 Kotlinによる関数型プログラミング入…
2ヶ月前
記事のアイキャッチ画像
DwarfStarでDeepSeek-V4-Flash-0731を試す。スピードは4倍になったけど評価は変わらず。
きしだのHatena
前回、llama.cppでDeepSeek-V4-Flash-0731を動かして芳しくなかったので、エンジンの実装の問題かと、今回はDwarfStarで試してみました。 DeepSeek-V4-Flash-0731を試す。コーディングにはお勧めできない。 - きしだのHatena こちらのサブスクのほうに過程をまとめてます。 で、まあ生成の評価がよくないのは変わらないけど、スピードは4倍になったので、動かすときはllama.cppよりもDwarfStarがいいです。SSDオフロードもあるので、128GBメモリのMacでロスレスのMXFP4版(168GB)が動かせます。 今回だと、Thymele…
2ヶ月前
記事のアイキャッチ画像
DeepSeek-V4-Flash-0731を試す。コーディングにはお勧めできない。
きしだのHatena
Previewとして出ていたDeepSeek-V4-Flashの正式版、DeepSeek-V4-Flash-0731が出てたので試します。 https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 UnslothさんのQ4_K_XLを使います。 https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF ※ Q8_K_XLがロスレス変換でQ4_K_XLとは7GBしか違わないので、Q4_K_XLは使わないほうがよさそう。 過程はこっちのサブスクにまとめてます。 とりあえず、コーディ…
2ヶ月前
記事のアイキャッチ画像
Inkling-Small 276B-A12Bを試す。中国系モデルが使えないなら貴重な選択肢
きしだのHatena
Thinking MachinesからInkling-Smallが出ていたので試しました。 Thinking Machinesは元OpenAIの研究者が共同創業したサンフランシスコの会社です。 ミラ・ムラティのThinking Machines Lab、初の製品「Tinker」を発表 | WIRED.jp Inkling-Smaillは276B-A12Bで、975BのInklingの小型版。 日本知識は結構ありそうだけど、表現力はない。Thinkingが長いので一問一答には向かない。コードは書けるけど融通きかなそう。 でも、中国系モデルが使えないところにはよさそう。 UnslothさんからGG…
2ヶ月前
記事のアイキャッチ画像
対話型世界シミュレーションモデルAbot-Worldを12GB VRAMで動かす
きしだのHatena
対話型世界シミュレーションモデルのAbot-Worldというのが出てました。 一枚の写真から、それっぽい世界を動き回れるというモデルです。 https://github.com/amap-cvlab/ABot-World ちなみに、モデルがAbot-World-0の5BでAbot-World-0-5B-LFになってるので0.5Bかと思うけど、5Bです。 これが、シングルGPUで動くってことなんだけど24GB VRAMが必要で、そしてLinux専用だったので、いろいろ削減して12GB VRAMでWindowsで動くようにしてみました。 メインメモリをかなり食うので、32GBは欲しいです。 修正点…
2ヶ月前
記事のアイキャッチ画像
Qwen3-30B-A3BなどのMoEでどのExpertが使われているかを確認する
きしだのHatena
最近の大きいモデルはたくさんのExpertを用意してトークンごとに必要なExpertを使って推論するMoE(Mixture of Experts)が主流です。 そうなると、どんな感じでExpertが選ばれてるのか気になりますね。 ということで、Qwen3とLFM2.5のMoEモデルでExpertを可視化してみました。ブラウザで動きます。 https://kishida.github.io/QwenQwen3.js/html/router-viz.html 対応モデル 対応モデルはQwen3とLFM2.5です。で、たぶんQwen3-235B-A22Bも動かせるのだけど、メモリ的に無理。 というこ…
2ヶ月前
記事のアイキャッチ画像
VRAM4GBくらいでQwen3.6-27Bが動くBonsai 27Bを試す
きしだのHatena
Qwen3.6-27Bが4GBくらいのメモリで動くというBonsai 27Bを試してみました。 0/1の2値で1bitでの量子化と、-1/0/1の3値(Ternary)で1.7bitでの量子化があります。 これ自体はあまり使えないけど、もっと大きいモデルでやるといいのかもしれない。 https://prismml.com/news/bonsai-27b 実行 1bit版はすでにllama.cpp本体に取り込まれてるので、本家のバイナリが使えます。なのでLM Studioからも動かせます。 Ternary版はMacとAMD系GPU(Vulkan)、CPUで動かす場合はllama.cpp本家が使え…
2ヶ月前