<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Llm on anotherjesse.com</title><link>https://anotherjesse.com/categories/llm/</link><description>Recent content in Llm on anotherjesse.com</description><generator>Hugo</generator><language>en-us</language><lastBuildDate>Mon, 04 Mar 2024 00:00:00 +0000</lastBuildDate><atom:link href="https://anotherjesse.com/categories/llm/index.xml" rel="self" type="application/rss+xml"/><item><title>Experimenting With Transformers &amp; Nokens</title><link>https://anotherjesse.com/posts/phi-nokens/</link><pubDate>Mon, 04 Mar 2024 00:00:00 +0000</pubDate><guid>https://anotherjesse.com/posts/phi-nokens/</guid><description>&lt;p&gt;Sometimes a single word isn&amp;rsquo;t enough. What if you could blend tokens or use non-tokens (aka nokens&lt;sup id="fnref:1"&gt;&lt;a href="#fn:1" class="footnote-ref" role="doc-noteref"&gt;1&lt;/a&gt;&lt;/sup&gt;)?&lt;/p&gt;
&lt;p&gt;Let&amp;rsquo;s explore these ideas, learn more about transformers: the architecture and Hugging Face library.&lt;/p&gt;
&lt;h2 id="installing--setup"&gt;Installing &amp;amp; Setup&lt;/h2&gt;
&lt;p&gt;I&amp;rsquo;m going to use Microsoft&amp;rsquo;s &lt;a href="https://huggingface.co/microsoft/phi-2"&gt;Phi-2&lt;/a&gt; as it is smaller than Mistral / Llama2. The ideas &lt;em&gt;should&lt;/em&gt; transfer to other transformer models.&lt;/p&gt;
&lt;p&gt;After &lt;code&gt;pip install transformers torch&lt;/code&gt;, we can load our language model to experiment with using the Hugging Face library.&lt;/p&gt;</description></item><item><title>Rorschach Test For LLaVA LLM</title><link>https://anotherjesse.com/posts/llava-rorschach/</link><pubDate>Sat, 30 Dec 2023 00:00:00 +0000</pubDate><guid>https://anotherjesse.com/posts/llava-rorschach/</guid><description>&lt;p&gt;LLaVA works by teaching an LLM (Llama2) to &amp;ldquo;understand&amp;rdquo; embeddings from an image model (CLIP). What happens if you replace the embeddings with randomness and ask the LLM questions about what it sees?&lt;/p&gt;
&lt;h2 id="hacking-llava"&gt;Hacking LLaVA&lt;/h2&gt;
&lt;p&gt;After loading the LLaVA model, we can inject a function that runs after clip embed but before projection to the LLMs token latent space.&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="background-color:#f7f7f7;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-python" data-lang="python"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#57606a"&gt;# load LLaVA using HF transformers&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;tokenizer&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; model&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; image_processor&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; context_len &lt;span style="color:#0550ae"&gt;=&lt;/span&gt; load_pretrained_model&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; &lt;span style="color:#0a3069"&gt;&amp;#34;liuhaotian/llava-v1.5-13b&amp;#34;&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; model_name&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#0a3069"&gt;&amp;#34;llava-v1.5-13b&amp;#34;&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; model_base&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#cf222e"&gt;None&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; load_8bit&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#cf222e"&gt;False&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; load_4bit&lt;span style="color:#0550ae"&gt;=&lt;/span&gt;&lt;span style="color:#cf222e"&gt;False&lt;/span&gt;&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#57606a"&gt;# inject hook that allows modifying the generated clip embed&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;tower &lt;span style="color:#0550ae"&gt;=&lt;/span&gt; model&lt;span style="color:#0550ae"&gt;.&lt;/span&gt;get_vision_tower&lt;span style="color:#1f2328"&gt;()&lt;/span&gt; 
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;tower&lt;span style="color:#0550ae"&gt;.&lt;/span&gt;register_forward_hook&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;random_forward_hook&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#57606a"&gt;# if global alter_seed set, override embed with randn of same shape&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;alter_seed &lt;span style="color:#0550ae"&gt;=&lt;/span&gt; &lt;span style="color:#cf222e"&gt;None&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;&lt;span style="color:#cf222e"&gt;def&lt;/span&gt; &lt;span style="color:#6639ba"&gt;random_forward_hook&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;module&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; &lt;span style="color:#6639ba"&gt;input&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; output&lt;span style="color:#1f2328"&gt;):&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; &lt;span style="color:#cf222e"&gt;if&lt;/span&gt; &lt;span style="color:#0550ae"&gt;not&lt;/span&gt; alter_seed &lt;span style="color:#0550ae"&gt;is&lt;/span&gt; &lt;span style="color:#cf222e"&gt;None&lt;/span&gt;&lt;span style="color:#1f2328"&gt;:&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; &lt;span style="color:#6639ba"&gt;print&lt;/span&gt;&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;&lt;span style="color:#0a3069"&gt;&amp;#34;overriding image embedding with seed: &amp;#34;&lt;/span&gt;&lt;span style="color:#1f2328"&gt;,&lt;/span&gt; alter_seed&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; torch&lt;span style="color:#0550ae"&gt;.&lt;/span&gt;manual_seed&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;alter_seed&lt;span style="color:#1f2328"&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; output&lt;span style="color:#1f2328"&gt;[&lt;/span&gt;&lt;span style="color:#0550ae"&gt;0&lt;/span&gt;&lt;span style="color:#1f2328"&gt;]&lt;/span&gt; &lt;span style="color:#0550ae"&gt;=&lt;/span&gt; torch&lt;span style="color:#0550ae"&gt;.&lt;/span&gt;randn_like&lt;span style="color:#1f2328"&gt;(&lt;/span&gt;output&lt;span style="color:#1f2328"&gt;[&lt;/span&gt;&lt;span style="color:#0550ae"&gt;0&lt;/span&gt;&lt;span style="color:#1f2328"&gt;])&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style="display:flex;"&gt;&lt;span&gt; &lt;span style="color:#cf222e"&gt;return&lt;/span&gt; output
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;You can try it out by running &lt;a href="https://replicate.com/anotherjesse/llava-lies"&gt;llava-lies on replicate&lt;/a&gt;. This model still asks for an image, to simplify the modification of LLaVA&amp;rsquo;s code. The hook &lt;code&gt;random_forward_hook&lt;/code&gt; above replaces the output with normalized seeded noise.&lt;/p&gt;</description></item></channel></rss>