<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>AI Safety on Federico Torrielli</title><link>https://federicotorrielli.me/tags/ai-safety/</link><description>Recent content in AI Safety on Federico Torrielli</description><generator>Hugo -- 0.152.2</generator><language>en</language><lastBuildDate>Mon, 03 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://federicotorrielli.me/tags/ai-safety/index.xml" rel="self" type="application/rss+xml"/><item><title>Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals</title><link>https://federicotorrielli.me/papers/activation-oracles-calibration/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://federicotorrielli.me/papers/activation-oracles-calibration/</guid><description>A comparison of confidence methods for activation oracles across Qwen and Gemma models. Revised preprint on arXiv.</description></item><item><title>Exploiting large language models in peer review: indirect prompt injection attacks and integrity probes</title><link>https://federicotorrielli.me/papers/ai-reviewer-prompt-injection/</link><pubDate>Sat, 11 Jul 2026 00:00:00 +0000</pubDate><guid>https://federicotorrielli.me/papers/ai-reviewer-prompt-injection/</guid><description>A study of indirect prompt injection attacks and integrity tests in AI assisted peer review. Published in Scientometrics.</description></item><item><title>The Energy Society: A Simulation Environment for Studying Agent Cooperation under Survival Pressure</title><link>https://federicotorrielli.me/papers/energy-society/</link><pubDate>Wed, 10 Jun 2026 00:00:00 +0000</pubDate><guid>https://federicotorrielli.me/papers/energy-society/</guid><description>A minimal survival-economy simulation environment for studying LLM-agent cooperation and competition under token-cost pressure. AITC 2026 poster on OpenReview.</description></item><item><title>The Arbiter Agent: Continually Monitoring Multi-Agent Conversations to Detect Emergent Misalignment</title><link>https://federicotorrielli.me/papers/arbiter-agent/</link><pubDate>Tue, 09 Jun 2026 00:00:00 +0000</pubDate><guid>https://federicotorrielli.me/papers/arbiter-agent/</guid><description>An active auditor agent for continual monitoring of multi-agent conversations to detect emergent misalignment. Preprint on arXiv and AITC 2026.</description></item><item><title>PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models</title><link>https://federicotorrielli.me/papers/psychosafe/</link><pubDate>Mon, 08 Jun 2026 00:00:00 +0000</pubDate><guid>https://federicotorrielli.me/papers/psychosafe/</guid><description>A psychologically informed refusal framework for large language models, evaluated with prompting and fine-tuning on high-risk request domains. Preprint on arXiv.</description></item><item><title>Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion</title><link>https://federicotorrielli.me/papers/emergent-languages-agent-populations/</link><pubDate>Fri, 29 May 2026 00:00:00 +0000</pubDate><guid>https://federicotorrielli.me/papers/emergent-languages-agent-populations/</guid><description>An analysis of emergent languages on Moltbook, including token-efficiency languages, new natural languages, and oversight-evasion protocols. Preprint on arXiv.</description></item><item><title>The Moltbook Files: A Harmless Slopocalypse or Humanity's Last Experiment</title><link>https://federicotorrielli.me/papers/moltbook-files/</link><pubDate>Fri, 08 May 2026 00:00:00 +0000</pubDate><guid>https://federicotorrielli.me/papers/moltbook-files/</guid><description>A dataset and empirical analysis of Moltbook agent activity, safety concerns, and downstream effects on language-model training. Preprint on arXiv.</description></item><item><title>Generative AI in the Public Administration</title><link>https://federicotorrielli.me/courses/genai-public-administration-2026/</link><pubDate>Thu, 15 Jan 2026 00:00:00 +0000</pubDate><guid>https://federicotorrielli.me/courses/genai-public-administration-2026/</guid><description>Comprehensive online course on Generative AI for public administration staff.</description></item></channel></rss>