Q4– tag –
-
IT/AIコンサルタント![[日本LLM] LLM-jp-3-8x1.8bのイメージ](data:image/gif;base64,R0lGODlhAQABAAAAACH5BAEKAAEALAAAAAABAAEAAAICTAEAOw==)
[日本LLM] LLM-jp-3-8×1.8b
これ、LLM-jpでも変な名前なんです。 LLM-jpはV3からV3.1そして最近V4になりました。 8x13B ≠ 104Bを毎token計算 8個のexpert全部を毎回動かすわけではありません。 8 expert中 2 expertだけをactivateするため、 重み全体:約73B 1 tokenあたりのactivate... -
IT/AIコンサルタント
LLM-JP 3 3.7B 量子化
このサイズを量子化すると非力なWindowsで普通に動くんじゃないかと思いやってみました。 ダウンロード Q4とQ5 悪くないけど、なぜかQ4の方が良さげなOutputをするときがあります。 -
IT/AIコンサルタント![[日本LLM] LLM-jp-4 33B 国立情報学研究所 量子化のイメージ](data:image/gif;base64,R0lGODlhAQABAAAAACH5BAEKAAEALAAAAAABAAEAAAICTAEAOw==)
[日本LLM] LLM-jp-4 33Bモデルの構造解析とローカル量子化の実践
国立情報学研究所(NII)が公開したLLM-jp-4 33Bを対象に、GGUF量子化におけるメモリ帯域のボトルネックと実用推論の境界線を徹底検証する。 -
IT/AIコンサルタント
[中華LLM] Qwen 27B 量子化検証(Q4 & IQ4)とメモリ帯域の考察
Qwen 27Bモデルを対象にQ4_K_MおよびIQ4_NLでGGUF量子化を実施。ファイルサイズ、メモリ帯域、非力マシンでの実用性を徹底検証。 -
IT/AIコンサルタント
Muse Glimmer 30B 量子化検証:ファイル構造とローカル実行のインプレッション
Muse Glimmer 30BモデルのGGUF量子化(Q4 / IQ4)を実施。生成崩れを防ぐためのパラメータ調整と検証ログを公開。
1

![[日本LLM] LLM-jp-3-8x1.8bのイメージ](https://saratna.com/wp-content/uploads/post-1413-featured.webp)

![[日本LLM] LLM-jp-4 33B 国立情報学研究所 量子化のイメージ](https://saratna.com/wp-content/uploads/llm-llm-jp-4-33b-featured.webp)

