<?xml version="1.0" encoding="utf-8" ?><feed xmlns="http://www.w3.org/2005/Atom" xmlns:tt="http://teletype.in/" xmlns:opensearch="http://a9.com/-/spec/opensearch/1.1/"><title>llmsecurity</title><author><name>llmsecurity</name></author><id>https://teletype.in/atom/llmsecurity</id><link rel="self" type="application/atom+xml" href="https://teletype.in/atom/llmsecurity?offset=0"></link><link rel="alternate" type="text/html" href="https://teletype.in/@llmsecurity?utm_source=teletype&amp;utm_medium=feed_atom&amp;utm_campaign=llmsecurity"></link><link rel="next" type="application/rss+xml" href="https://teletype.in/atom/llmsecurity?offset=10"></link><link rel="search" type="application/opensearchdescription+xml" title="Teletype" href="https://teletype.in/opensearch.xml"></link><updated>2026-10-06T10:10:22.659Z</updated><entry><id>llmsecurity:jFb8fH82-B8</id><link rel="alternate" type="text/html" href="https://teletype.in/@llmsecurity/jFb8fH82-B8?utm_source=teletype&amp;utm_medium=feed_atom&amp;utm_campaign=llmsecurity"></link><title>Словарь безопасного ИИ</title><published>2024-09-23T22:42:26.539Z</published><updated>2024-10-16T21:41:12.368Z</updated><summary type="html">Тема безопасности искусственного интеллекта очень молодая и активно развивается. В первую очередь она делает это в англоязычном пространстве, из-за чего многие термины (те же LLM) приходят к нам в английском виде, а на русском или не существуют, или выглядят непривычно и иногда даже забавно (БЯМ). Это - пополняемый двуязычный словарь терминов с переводом на русский язык, в котором мы попытаемся дать русскоязычные замены для стандартных для сферы варваризмов.</summary><content type="html">
  &lt;p id=&quot;cxHJ&quot;&gt;[work in progress]&lt;/p&gt;
  &lt;p id=&quot;o61c&quot;&gt;Тема безопасности искусственного интеллекта очень молодая и активно развивается. В первую очередь она делает это в англоязычном пространстве, из-за чего многие термины (те же LLM) приходят к нам в английском виде, а на русском или не существуют, или выглядят непривычно и иногда даже забавно (БЯМ). Это - пополняемый двуязычный словарь терминов с переводом на русский язык, в котором мы попытаемся дать русскоязычные замены для стандартных для сферы варваризмов. &lt;/p&gt;
  &lt;p id=&quot;SJjM&quot;&gt;Любой перевод дискуссионен.&lt;/p&gt;
  &lt;p id=&quot;CtOW&quot;&gt;&lt;strong&gt;Alignment &lt;/strong&gt;- согласование. &lt;/p&gt;
  &lt;p id=&quot;XVEu&quot;&gt;Подразумевается, что результаты работы модели согласуются с целями, с которыми человек ее обучает и применяет, а методы достижения этих целей - с определенным набором ценностей. Перевод &lt;em&gt;согласованность&lt;/em&gt; возможен, если под alignment подразумевается именно результат, а не процесс. Менее удачным кажется &lt;em&gt;выравнивание &lt;/em&gt;(выравнивание с ценностями? относительно ценностей?). Вероятно, хорошим переводом может быть &lt;em&gt;гармонизация &lt;/em&gt;(гармонизированная модель, гармонизация с ценностями, проблема гармонизации), но момент скорее всего быть упущен.&lt;/p&gt;
  &lt;p id=&quot;VQF0&quot;&gt;Capability uplift&lt;/p&gt;
  &lt;p id=&quot;8ETo&quot;&gt;Evaluation harness&lt;/p&gt;
  &lt;p id=&quot;OH3e&quot;&gt;&lt;strong&gt;Large language model (LLM)&lt;/strong&gt; - большая языковая модель. &lt;/p&gt;
  &lt;p id=&quot;EtNo&quot;&gt;То, что в английском существует аббревиатура, не значит, что она всенепременно должна существовать на русском: скажите на встрече с клиентом, что ваш проект использует самые мощные &lt;em&gt;бямы &lt;/em&gt;от ведущих&lt;em&gt; бям&lt;/em&gt;-провайдеров, и посмотрите на результат.&lt;/p&gt;

</content></entry><entry><id>llmsecurity:toc</id><link rel="alternate" type="text/html" href="https://teletype.in/@llmsecurity/toc?utm_source=teletype&amp;utm_medium=feed_atom&amp;utm_campaign=llmsecurity"></link><title>LLM Security</title><published>2024-02-06T18:30:14.513Z</published><updated>2026-01-18T19:29:49.704Z</updated><summary type="html">Разборы статей, блогов и новостей про безопасность и атаки на большие языковые модели.</summary><content type="html">
  &lt;p id=&quot;mQjT&quot;&gt;Разборы статей, блогов и новостей про безопасность и атаки на большие языковые модели.&lt;/p&gt;
  &lt;h2 id=&quot;6Jaa&quot;&gt;Джейлбрейки&lt;/h2&gt;
  &lt;ul id=&quot;mNSu&quot;&gt;
    &lt;li id=&quot;Ocjn&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/10&quot; target=&quot;_blank&quot;&gt;Jailbroken: How Does LLM Safety Training Fail?, Wei et al., 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;kAlh&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/15&quot; target=&quot;_blank&quot;&gt;Universal and Transferable Adversarial Attacks on Aligned Language Models, Zou et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;7PNA&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/21&quot; target=&quot;_blank&quot;&gt;AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models, Liu et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;LMR5&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/28&quot; target=&quot;_blank&quot;&gt;MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots, Deng et al., 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;kROf&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/34&quot; target=&quot;_blank&quot;&gt;Jailbreaking ChatGPT via Prompt Engineering: An Empirical Study, Liu et al., 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;VLra&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/38&quot; target=&quot;_blank&quot;&gt;Jailbreaking Black Box Large Language Models in Twenty Queries, Chao et al., 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;3JcS&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/45&quot; target=&quot;_blank&quot;&gt;Tree of Attacks: Jailbreaking Black-Box LLMs Automatically, Mehrotra et al., 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;zwx5&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/52&quot; target=&quot;_blank&quot;&gt;Fundamental Limitations of Alignment in Large Language Models, Wolf et al., 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;5AF4&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/67&quot; target=&quot;_blank&quot;&gt;Summon a Demon and Bind it: A Grounded Theory of LLM Red Teaming in the Wild, Inie et al., 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;O6iV&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/101&quot; target=&quot;_blank&quot;&gt;ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs, Jiang et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;wWUG&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/169&quot; target=&quot;_blank&quot;&gt;Refusal in Language Models Is Mediated by a Single Direction, Arditi et al, 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;NbWW&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/299&quot; target=&quot;_blank&quot;&gt;Does Refusal Training in LLMs Generalize to the Past Tense?, Andriushchenko and Flammarion, 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;ZsZv&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/407?single&quot; target=&quot;_blank&quot;&gt;Best-of-N Jailbreaking, John Hughes et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;vD9D&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/437&quot; target=&quot;_blank&quot;&gt;Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack, Mark Russinovich et al, Microsoft, 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;Ix2d&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/448&quot; target=&quot;_blank&quot;&gt;Removing RLHF Protections in GPT-4 via Fine-Tuning, Qiusi Zhan et al., 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;Ja7H&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/454&quot; target=&quot;_blank&quot;&gt;Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models, Xianjun Yang et al, 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;RBlz&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/463&quot; target=&quot;_blank&quot;&gt;LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B, Simon Lermen et al, 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;v87n&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/529&quot; target=&quot;_blank&quot;&gt;Obfuscated Activations Bypass LLM Latent-Space Defenses, Bailey et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;xpYq&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/552?single&quot; target=&quot;_blank&quot;&gt;Fast Adversarial Attacks on Language Models In One GPU Minute, Sadasivan et al., University of Maryland, 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;7u3q&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/658?single&quot; target=&quot;_blank&quot;&gt;Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models, Bisconti et al., 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;xZ3j&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/668&quot; target=&quot;_blank&quot;&gt;In-Context Representation Hijacking, Yona et al., 2025&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h2 id=&quot;5IxR&quot;&gt;Prompt Injection&lt;/h2&gt;
  &lt;ul id=&quot;gtdy&quot;&gt;
    &lt;li id=&quot;t4sP&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/61&quot; target=&quot;_blank&quot;&gt;Not what you&amp;#x27;ve signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection, Greshake at a.l, 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;Au2g&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/72&quot; target=&quot;_blank&quot;&gt;ComPromptMized: Unleashing Zero-click Worms that Target GenAI-Powered Applications, Cohen et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;QDVM&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/81&quot; target=&quot;_blank&quot;&gt;A New Era in LLM Security: Exploring Security Concerns in Real-World LLM-based Systems, Wu et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;pQCs&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/159&quot; target=&quot;_blank&quot;&gt;The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions, Wallace et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;QU9r&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/188&quot; target=&quot;_blank&quot;&gt;Knowledge Return Oriented Prompting (KROP), Martin et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;sfFi&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/639?single&quot; target=&quot;_blank&quot;&gt;RL Is a Hammer and LLMs Are Nails: A Simple Reinforcement Learning Recipe for Strong Prompt Injection, Wen at al., 2025&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h2 id=&quot;pYBh&quot;&gt;Атаки на агентные системы&lt;/h2&gt;
  &lt;ul id=&quot;j3cE&quot;&gt;
    &lt;li id=&quot;6CtO&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/294&quot; target=&quot;_blank&quot;&gt;Data Exfiltration from Slack AI via indirect prompt injection, PromptArmor, 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;hKvd&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/586&quot; target=&quot;_blank&quot;&gt;Hacker Plants Computer &amp;#x27;Wiping&amp;#x27; Commands in Amazon&amp;#x27;s AI Coding Agent&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;HTb4&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/588?single&quot; target=&quot;_blank&quot;&gt;Invitation Is All You Need! TARA for Targeted Promptware Attack Against Gemini-Powered Assistants, Nassi et al., 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;xdOi&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/635&quot; target=&quot;_blank&quot;&gt;ForcedLeak: AI Agent risks exposed in Salesforce AgentForce, Sasi Levi, Noma Security, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;zNrO&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/636&quot; target=&quot;_blank&quot;&gt;Breaking down ‘EchoLeak’, the First Zero-Click AI Vulnerability Enabling Data Exfiltration from Microsoft 365 Copilot, Itay Ravia, Aim Labs, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;jerZ&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/666&quot; target=&quot;_blank&quot;&gt;CVE-2025-53773 - Visual Studio &amp;amp; Copilot – Wormable Command Execution via Prompt Injection, Persistent Security, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;4HMV&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/667&quot; target=&quot;_blank&quot;&gt;CamoLeak: Critical GitHub Copilot Vulnerability Leaks Private Source Code Legit Security, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;CFpx&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/679&quot; target=&quot;_blank&quot;&gt;Notion AI: Unpatched Data Exfiltration, PromptArmor, 2026&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h2 id=&quot;8rEO&quot;&gt;Inference Cost / Sponge-атаки&lt;/h2&gt;
  &lt;ul id=&quot;P8oa&quot;&gt;
    &lt;li id=&quot;FUBt&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/680?single&quot; target=&quot;_blank&quot;&gt;OverThink: Slowdown Attacks on Reasoning LLMs, Kumar et al., University of Massachusetts Amherst, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;wSxf&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/517&quot; target=&quot;_blank&quot;&gt;Trapping misbehaving bots in an AI Labyrinth, Tatoris, Saxena and Miglietti, Cloudflare, 2025&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h2 id=&quot;fnYO&quot;&gt;LLM misuse&lt;/h2&gt;
  &lt;ul id=&quot;Bo1t&quot;&gt;
    &lt;li id=&quot;YGUN&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/339&quot; target=&quot;_blank&quot;&gt;An update on disrupting deceptive uses of AI, Nimmo &amp;amp; Flossman, OpenAI, 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;II3X&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/471&quot; target=&quot;_blank&quot;&gt;Adversarial Misuse of Generative AI, Google Threat Intelligence Group, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;wI8A&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/502&quot; target=&quot;_blank&quot;&gt;Disrupting malicious uses of AI: February 2025 update, Nimmo et al., OpenAI, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;7eqK&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/538&quot; target=&quot;_blank&quot;&gt;Unmasking EncryptHub: Help from ChatGPT &amp;amp; OPSEC blunders, Kraken Labs, Outpust24, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;lumh&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/548&quot; target=&quot;_blank&quot;&gt;LLM Agent Honeypot: Monitoring AI Hacking Agents in the Wild, Reworr and Dmitrii Volkov, Palisade Research, 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;68wX&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/572&quot; target=&quot;_blank&quot;&gt;Disrupting malicious uses of AI: June 2025, OpenAI, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;vtKf&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/617&quot; target=&quot;_blank&quot;&gt;Threat Intelligence Report: August 2025, Anthropic, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;7j5l&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/647&quot; target=&quot;_blank&quot;&gt;Disrupting malicious uses of our models: an update, October 2025, OpenAI, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;G9VC&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/649&quot; target=&quot;_blank&quot;&gt;GTIG AI Threat Tracker: Advances in Threat Actor Usage of AI Tools, Google Threat Intelligence Group, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;mvJK&quot;&gt;&lt;a href=&quot;http://Disrupting%20the%20first%20reported%20AI-orchestrated%20cyber%20espionage%20campaign%20Anthropic,%202025&quot; target=&quot;_blank&quot;&gt;Disrupting the first reported AI-orchestrated cyber espionage campaign&lt;br /&gt;Anthropic, 2025&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h2 id=&quot;owqv&quot;&gt;LLM в offensive security&lt;/h2&gt;
  &lt;ul id=&quot;fP4d&quot;&gt;
    &lt;li id=&quot;R7bH&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/472&quot; target=&quot;_blank&quot;&gt;Evaluating Large Language Models&amp;#x27; Capability to Launch Fully Automated Spear Phishing Campaigns: Validated on Human Subjects, Heiding et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;tfoP&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/345&quot; target=&quot;_blank&quot;&gt;Catastrophic Cyber Capabilities Benchmark (3CB): Robustly Evaluating LLM Agent Cyber Offense Capabilities, Anurin et al., Apart Research, 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;5GML&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/567&quot; target=&quot;_blank&quot;&gt;Evaluating AI cyber capabilities with crowdsourced elicitation, Petrov and Volkov, Palisade Research, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;NaCe&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/612&quot; target=&quot;_blank&quot;&gt;XBOW Unleashes GPT-5’s Hidden Hacking Power, Doubling Performance, De Moor, Ziegler, XBOW, 2025&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h2 id=&quot;YAhe&quot;&gt;LLM в киберзащите&lt;/h2&gt;
  &lt;ul id=&quot;ohDl&quot;&gt;
    &lt;li id=&quot;9eja&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/593&quot; target=&quot;_blank&quot;&gt;BinMetric: A Comprehensive Binary Analysis Benchmark for Large Language Models, Shang et al., Hefei University of Science and Technology, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;MW0O&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/599&quot; target=&quot;_blank&quot;&gt;LLM4Decompile: Decompiling Binary Code with Large Language Models, Tan et al., 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;XbC3&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/607&quot; target=&quot;_blank&quot;&gt;DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios, Gao et al., 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;No3Q&quot;&gt;&lt;a href=&quot;CyberSOCEval:%20Benchmarking%20LLMs%20Capabilities%20for%20Malware%20Analysis%20and%20Threat%20Intelligence%20Reasoning%20Deason%20et%20al.,%202025&quot; target=&quot;_blank&quot;&gt;CyberSOCEval: Benchmarking LLMs Capabilities for Malware Analysis and Threat Intelligence Reasoning, Deason et al., 2025&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h2 id=&quot;R9VC&quot;&gt;Защита LLM-систем&lt;/h2&gt;
  &lt;ul id=&quot;9Fry&quot;&gt;
    &lt;li id=&quot;iJ7d&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/89&quot; target=&quot;_blank&quot;&gt;Baseline Defenses for Adversarial Attacks Against Aligned Language Models, Jain et al., 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;LubX&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/117&quot; target=&quot;_blank&quot;&gt;Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes, Hu et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;PE2n&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/149&quot; target=&quot;_blank&quot;&gt;Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations, Inan et al., 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;2Td2&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/255&quot; target=&quot;_blank&quot;&gt;ShieldGemma: Generative AI Content Moderation Based on Gemma, ShieldGemma Team, Google LLC, 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;nvWo&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/367&quot; target=&quot;_blank&quot;&gt;Rapid Response: Mitigating LLM Jailbreaks with a Few Examples, Peng et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;w9Mc&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/385&quot; target=&quot;_blank&quot;&gt;Defending Against Indirect Prompt Injection Attacks With Spotlighting, Keegan Hines et al, Microsoft, 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;mkfM&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/398&quot; target=&quot;_blank&quot;&gt;Are you still on track!? Catching LLM Task Drift with Activations, Abdelnabi et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;i08N&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/482&quot; target=&quot;_blank&quot;&gt;Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming, Mrinank Sharma et al., Anthropic. 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;0jye&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/519&quot; target=&quot;_blank&quot;&gt;The Dual LLM pattern for building AI assistants that can resist prompt injection, Simon Willison, 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;cBfW&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/559&quot; target=&quot;_blank&quot;&gt;LlamaFirewall: An open source guardrail system for building secure AI agents, Chennabasappa et al, Meta, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;C58K&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/663&quot; target=&quot;_blank&quot;&gt;Introducing gpt-oss-safeguard, OpenAI &amp;amp; ROOST, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;NVVW&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/686&quot; target=&quot;_blank&quot;&gt;Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks, Cunningham et al., Anthropic, 2026&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;zlQ6&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/627&quot; target=&quot;_blank&quot;&gt;Qwen3 Guard, Qwen Team, 2025&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h2 id=&quot;G67N&quot;&gt;Бенчмарки&lt;/h2&gt;
  &lt;ul id=&quot;rYH0&quot;&gt;
    &lt;li id=&quot;T3xW&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/128&quot; target=&quot;_blank&quot;&gt;Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models, Bhatt et al., 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;WaPr&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/136&quot; target=&quot;_blank&quot;&gt;CYBERSECEVAL 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models, Bhatt et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;89P8&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/215&quot; target=&quot;_blank&quot;&gt;CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models, Wan et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;K0Sd&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/286&quot; target=&quot;_blank&quot;&gt;AIR-BENCH 2024: A Safety Benchmark Based on Risk Categories from Regulations and Policies, Zeng et al., 2024 &lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;kiwy&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/327&quot; target=&quot;_blank&quot;&gt;AgentDojo: A Dynamic Environment to Evaluate Attacks and Defenses for LLM Agents, Edoardo Debenedetti et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;JBlm&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/309&quot; target=&quot;_blank&quot;&gt;A StrongREJECT for Empty Jailbreaks, Souly et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;vH0v&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/494&quot; target=&quot;_blank&quot;&gt;Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models, Andy K. Zhang et al, Stanford, 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;yCtD&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/373&quot; target=&quot;_blank&quot;&gt;The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning, Li et al, 2024&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h2 id=&quot;KyL6&quot;&gt;Policy&lt;/h2&gt;
  &lt;ul id=&quot;fGCj&quot;&gt;
    &lt;li id=&quot;jEvO&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/185&quot; target=&quot;_blank&quot;&gt;The Coming Wave, Mustafa Suleyman, 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;JFcR&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/232&quot; target=&quot;_blank&quot;&gt;AI existential risk probabilities are too unreliable to inform policy, Narayanan and Kapoor, 2024&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h2 id=&quot;bkp3&quot;&gt;Safety &amp;amp; Reliability&lt;/h2&gt;
  &lt;ul id=&quot;y3O3&quot;&gt;
    &lt;li id=&quot;eQiG&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/195&quot; target=&quot;_blank&quot;&gt;Towards Understanding Sycophancy in Language Models, Sharma et al, 2023&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;oJSz&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/205&quot; target=&quot;_blank&quot;&gt;Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models, Denison et al, 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;n5po&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/272&quot; target=&quot;_blank&quot;&gt;AI Risk Categorization Decoded (AIR 2024): From Government Regulations to Corporate Policies, Zeng et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;VvLO&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/359&quot; target=&quot;_blank&quot;&gt;Constitutional AI: Harmlessness from AI Feedback, Bai et al., Anthropic, 2022&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;ZYcP&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/415&quot; target=&quot;_blank&quot;&gt;Frontier Models are Capable of In-context Scheming, Alexander Meinke et al., Apollo Research, 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;CN67&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/505&quot; target=&quot;_blank&quot;&gt;Demonstrating specification gaming in reasoning models, Alexander Bondarenko et al., Palisade Research, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;KUh6&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/513&quot; target=&quot;_blank&quot;&gt;Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs, Jan Betley et al., 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;1eIW&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/522&quot; target=&quot;_blank&quot;&gt;Reasoning models don&amp;#x27;t always say what they think, Chen et al., Anthropic, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;P40E&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/544&quot; target=&quot;_blank&quot;&gt;Claude Sonnet 3.7 (often) knows when it’s in alignment evaluations, Apollo Research, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;xqsM&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/579&quot; target=&quot;_blank&quot;&gt;SHADE-Arena: Evaluating sabotage and monitoring in LLM agents, Kutasov et al., 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;c0Oz&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/620&quot; target=&quot;_blank&quot;&gt;Spiral-Bench, Samuel Paech, 2025&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h3 id=&quot;9zKl&quot;&gt;AI Alignment Course&lt;/h3&gt;
  &lt;ul id=&quot;PPFD&quot;&gt;
    &lt;li id=&quot;q1z9&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/322&quot; target=&quot;_blank&quot;&gt;Week 1: AI and the Years Ahead&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;EOuG&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/353&quot; target=&quot;_blank&quot;&gt;Week 2: What is AI alignment&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h2 id=&quot;448f&quot;&gt;Model Stealing &amp;amp; Inversion&lt;/h2&gt;
  &lt;ul id=&quot;N1xc&quot;&gt;
    &lt;li id=&quot;gCso&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/237&quot; target=&quot;_blank&quot;&gt;LLMmap: Fingerprinting For Large Language Models, Pasquini et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;LtIC&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/246&quot; target=&quot;_blank&quot;&gt;Stealing Part of a Production Language Model, Carlini et al., 2024&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h2 id=&quot;1qaA&quot;&gt;Гайдлайны&lt;/h2&gt;
  &lt;ul id=&quot;YjLR&quot;&gt;
    &lt;li id=&quot;6zYY&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/355&quot; target=&quot;_blank&quot;&gt;Google&amp;#x27;s Secure AI Framework: A practitioner’s guide to navigating AI security &lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h2 id=&quot;VcIz&quot;&gt;Misc&lt;/h2&gt;
  &lt;ul id=&quot;Emf8&quot;&gt;
    &lt;li id=&quot;EGJK&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/110&quot; target=&quot;_blank&quot;&gt;What Was Your Prompt? A Remote Keylogging Attack on AI Assistants, Weiss et al., 2024&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;KzaY&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/491&quot; target=&quot;_blank&quot;&gt;Smuggling arbitrary data through an emoji, Paul Butler, 2025&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;r0vk&quot;&gt;&lt;a href=&quot;https://t.me/llmsecurity/576&quot; target=&quot;_blank&quot;&gt;LLM Backdoors at the Inference Level: The Threat of Poisoned Templates, Ariel Fogel, 2025, Pillar Security&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;h2 id=&quot;XIro&quot;&gt;Полезные каналы&lt;/h2&gt;
  &lt;ul id=&quot;JTnX&quot;&gt;
    &lt;li id=&quot;PTvY&quot;&gt;&lt;a href=&quot;https://t.me/addlist/40D9BRf6rDoxNzg6&quot; target=&quot;_blank&quot;&gt;https://t.me/addlist/40D9BRf6rDoxNzg6&lt;/a&gt; - большой список каналов на тему AI + Security&lt;/li&gt;
    &lt;li id=&quot;QKRH&quot;&gt;&lt;a href=&quot;https://t.me/pwnai&quot; target=&quot;_blank&quot;&gt;https://t.me/pwnai&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;sRVy&quot;&gt;&lt;a href=&quot;https://t.me/rybolos_channel&quot; target=&quot;_blank&quot;&gt;https://t.me/rybolos_channel&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;DK4L&quot;&gt;&lt;a href=&quot;https://t.me/aisecnews&quot; target=&quot;_blank&quot;&gt;https://t.me/aisecnews&lt;/a&gt;&lt;/li&gt;
    &lt;li id=&quot;0OqB&quot;&gt;&lt;a href=&quot;https://t.me/kokuykin&quot; target=&quot;_blank&quot;&gt;https://t.me/kokuykin&lt;/a&gt;&lt;/li&gt;
  &lt;/ul&gt;
  &lt;p id=&quot;d0jx&quot;&gt;Теги: &lt;em&gt;AI Safety, AI Security, LLM Security, LLM Safety, Adversarial ML, AI in Cybersecurity, атаки на LLM, атаки на большие языковые модели, защита больших языковых моделей, разборы на русском языке&lt;/em&gt;&lt;/p&gt;

</content></entry></feed>