Sens.aiAI signal desk
TodayRadarBriefing
Admin sign in
Sens.aiSensif.aiAI signal desk
ModelsResearchCountriesOpen vs ClosedComputeBetaCommentary
Loading…
TodayRadarBriefingAdmin

Radar

Research Radar

Which research topics are accelerating, and where earlier papers have already landed in shipped models.

Filtered to Safety & Alignment — 89 papersClear filter

Papers this week

50

Trending topic

Agents

▲ 21%

papers this window vs prior window

Papers linked to models

134

linked by the desk, past 90 days

Median days paper → model

—

lower is faster

Topic velocity

papers this window by topic · Δ vs prior window · a paper can carry more than one topic

AgentsAgents
135▲21%
Evaluation & BenchmarksEvaluation & Benchmarks
39▲44%
MultimodalMultimodal
24▼27%
Safety & AlignmentSafety & Alignment
View as table
TopicPapers this windowPrior windowΔ
Agents135112+21%
Evaluation & Benchmarks3927+44%
Multimodal2433-27%

Topic momentum

prior window → this window

Agents

135 this window ▲21%

Evaluation & Benchmarks

39 this window ▲44%

Multimodal

24 this window ▼27%

Where research lands: paper → model linkage

Links are AI-inferred by the desk's LLM from tech reports, system cards and citations — each carries a confidence level and is not a claim by the authors.

HiMA-MDD: A Hierarchical Multi-Agent Harness for Interpretable Multimodal Depression Detection in Clinical Interviews

arXiv:2608.21868AI-inferred · high

Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning

arXiv:2608.21811AI-inferred · high

HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries

arXiv:2608.21792AI-inferred · high

ATHENA: Knowledge-guided agentic neural architecture search for AutoFormer-based electronic health record modeling

Filtered to Safety & Alignment — 89 papersClear filter

Papers on Safety & Alignment

Clear filter
conversational AIAI safetypublished Aug 25, 2026 · arXiv:2608.21841

AI Watchdog: Agent Interfaces for Detecting and Defending Against Manipulative Dark Patterns in AI Conversations

activation controllabilitylatent-space monitoringpublished Aug 25, 2026 · arXiv:2608.21664

Measuring Activation Control in Large Language Models

22▲47%
Training & OptimizationTraining & Optimization
21▲50%
Efficiency & InferenceEfficiency & Inference
20▼5%
ReasoningReasoning
15▲36%
InterpretabilityInterpretability
12▼20%
Reinforcement LearningReinforcement Learning
10▼29%
Retrieval & RAGRetrieval & RAG
9▼18%
Code GenerationCode Generation
8▼27%
Privacy & SecurityPrivacy & Security
7▲250%
Language UnderstandingLanguage Understanding
5▲25%
Generative ModelsGenerative Models
5▼67%
Robotics & Embodied AIRobotics & Embodied AI
5▼29%
Long ContextLong Context
4▼20%
Speech & AudioSpeech & Audio
4▼33%
Mixture of ExpertsMixture of Experts
3▲50%
Computer VisionComputer Vision
3▼63%
Data & Synthetic DataData & Synthetic Data
1▼75%
OtherOther
164▲11%
Safety & Alignment
22
15
+47%
Training & Optimization2114+50%
Efficiency & Inference2021-5%
Reasoning1511+36%
Interpretability1215-20%
Reinforcement Learning1014-29%
Retrieval & RAG911-18%
Code Generation811-27%
Privacy & Security72+250%
Language Understanding54+25%
Generative Models515-67%
Robotics & Embodied AI57-29%
Long Context45-20%
Speech & Audio46-33%
Mixture of Experts32+50%
Computer Vision38-62%
Data & Synthetic Data14-75%
Other164148+11%

Safety & Alignment

22 this window ▲47%

Training & Optimization

21 this window ▲50%

Efficiency & Inference

20 this window ▼5%
arXiv:2608.21712AI-inferred · high

Context as an Environment: Programmatic Context Management for Long-Horizon Agents

arXiv:2608.21690AI-inferred · high

From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation

arXiv:2608.21668AI-inferred · high

Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning

arXiv:2608.21501AI-inferred · high

KVBoost: Chunk-Level Key-Value Cache Reuse with Deviation-Guided Recomputation for Efficient Large Language Model Inference

arXiv:2608.21362AI-inferred · high

K-Bench: measuring model performance on real scientific agent requests

arXiv:2608.21601AI-inferred · high

IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents

arXiv:2608.06735AI-inferred · high

NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

arXiv:2608.07167AI-inferred · high
Qwen 3.8 Max6 links
Athena-Brain-8B1 link
GPT-5.63 links
claude-fable-5, claude-sonnet-5, claude-opus-52 links
Gemini 3.7 Flash1 link
DeepSeek-V4-Flash-07311 link
View as table
PaperLinked modelRelationConfidence
HiMA-MDD: A Hierarchical Multi-Agent Harness for Interpretable Multimodal Depression Detection in Clinical Interviews (2608.21868)Qwen 3.8 Maxtechnique used99%
Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning (2608.21811)Qwen 3.8 Maxevaluates98%
HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries (2608.21792)Qwen 3.8 Maxtechnique used99%
ATHENA: Knowledge-guided agentic neural architecture search for AutoFormer-based electronic health record modeling (2608.21712)Athena-Brain-8Btechnique used99%
Context as an Environment: Programmatic Context Management for Long-Horizon Agents (2608.21690)Qwen 3.8 Maxevaluates95%
From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation (2608.21668)GPT-5.6evaluates98%
From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation (2608.21668)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation (2608.21668)Gemini 3.7 Flashevaluates98%
Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning (2608.21501)Qwen 3.8 Maxevaluates99%
KVBoost: Chunk-Level Key-Value Cache Reuse with Deviation-Guided Recomputation for Efficient Large Language Model Inference (2608.21362)Qwen 3.8 Maxevaluates98%
K-Bench: measuring model performance on real scientific agent requests (2608.21601)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates100%
K-Bench: measuring model performance on real scientific agent requests (2608.21601)GPT-5.6evaluates100%
IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents (2608.06735)DeepSeek-V4-Flash-0731evaluates95%
NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs (2608.07167)GPT-5.6evaluates98%
WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader (2608.06474)GPT-5.6evaluates99%
Divergent Response Modes in Frontier Language Models Under Steering Pressure (2608.06578)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
Divergent Response Modes in Frontier Language Models Under Steering Pressure (2608.06578)GPT-5.6evaluates99%
Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory (2608.07169)GPT-5.6 Lunatechnique used98%
Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills (2608.07885)GPT-5.6 Lunaevaluates98%
SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents (2608.08055)DeepSeek-V4-Flash-0731technique used98%
Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation (2608.07762)DeepSeek-V4-Flash-0731evaluates98%
Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation (2608.07762)GLM-5.3evaluates98%
Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation (2608.07762)GPT-5.6 Lunaevaluates98%
An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography (2608.07651)GPT-5.6 Lunaevaluates99%
An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography (2608.07651)Gemini 3.7 Flashevaluates99%
When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines (2608.07813)DeepSeek-V4-Flash-0731evaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)Grok 4.6evaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)GPT-5.6 Lunaevaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)Gemini 3.7 Flashevaluates95%
The Authority Expectancy Effect in Multi-User Conflict (2608.08026)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates95%
Can Legal AI Know When It Is Wrong? And Do Students Know When It Is? (2608.21089)GPT-5.6 Lunaevaluates99%
Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol (2608.20729)Qwen 3.8 Maxevaluates98%
Why2Speak: Faithful Reasoning for Abstaining Action Policies (2608.20670)Qwen 3.8 Maxevaluates98%
No Judgment Without a Reason: Counterfactual Receipts for Versioned AI Evaluators (2608.20938)Qwen 3.8 Maxevaluates99%
Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation (2608.20797)Qwen 3.8 Maxtechnique used98%
Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization (2608.20768)GPT-5.6 Lunaevaluates99%
Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization (2608.20768)Qwen 3.8 Maxevaluates99%
Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization (2608.20768)Gemma 4evaluates99%
Natural-Language-Guided Generator-Agnostic Shortlisting for Protein Binder Design (2608.20755)GPT-5.6 Lunatechnique used95%
DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning (2608.20717)Gemma 4evaluates95%
DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning (2608.20717)Mistral OCR 4evaluates95%
DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning (2608.20717)Qwen 3.8 Maxevaluates95%
Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory (2608.20397)Qwen 3.8 Maxevaluates99%
Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification (2608.20378)Gemma 4evaluates98%
Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification (2608.20378)Qwen 3.8 Maxevaluates98%
PrimeAgentOrchestrator: Memory-Primed Agent Spawning for Personal AI Infrastructure (2608.20342)claude-fable-5, claude-sonnet-5, claude-opus-5technique used98%
Personalized Privacy Control in LLMs via Attention Head Intervention (2608.21209)Qwen 3.8 Maxevaluates99%
TreeWY: Speculative Verification for Gated DeltaNet Hybrids (2608.20961)Qwen 3.8 Maxevaluates98%
Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents (2608.20631)Gemma 4evaluates99%
Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents (2608.20631)Qwen 3.8 Maxevaluates99%
FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth (2608.20574)Grok 4.6evaluates99%
StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models (2608.20414)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models (2608.20414)GPT-5.6 Lunaevaluates99%
SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation (2608.10775)GPT-5.6 Lunaevaluates98%
CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation (2608.10090)DeepSeek-V4-Flash-0731evaluates98%
DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments? (2608.10366)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence (2608.11341)GPT-5.6 Lunaevaluates98%
AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research (2608.11216)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
MBA: Multimodal Benchmark and Agents for Real-World Business Ideation (2608.11616)GPT-5.6 Lunatechnique used98%
When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs (2608.11403)Qwen 3.8 27Bevaluates99%
XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication (2608.11676)Qwen 3.8 27Bevaluates95%
Graph-Structured Rubrics: Compiling Rubrics into Typed Evaluation Graphs for LLM Judges (2608.12097)GPT-5.6 Lunaevaluates95%
HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting (2608.11692)Qwen 3.8 27Bevaluates99%
Claim-Level Reliability Assessment for Efficient Test-Time Reasoning (2608.11994)GPT-5.6 Lunaevaluates95%
From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European Listed Real Estate (2608.11381)Qwen 3.8 27Btechnique used98%
Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets (2608.11233)Qwen 3.8 27Btechnique used99%
Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs (2608.11232)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates95%
Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs (2608.11232)GPT-5.6 Lunaevaluates95%
FrontierFinance: A Challenging Benchmark for Measuring Frontier Intelligence of Finance Agents (2608.11683)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence (2608.12036)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates86%
Harnessing agent memory to build lifelong AI partners for materials scientists (2608.11224)GPT-5.6 Lunaevaluates95%
Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval (2608.11343)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval (2608.11343)GPT-5.6 Lunaevaluates99%
An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Core of GAMESS (2608.12249)claude-fable-5, claude-sonnet-5, claude-opus-5technique used95%
Distribird: Literature-Informed Prior Distribution Design for Bayesian Model Calibration (2608.11210)Qwen 3.8 27Bevaluates95%
From Monolithic to Modular: Segment-level Automatic Prompt Optimization (2608.11219)GPT-5.6 Lunaevaluates98%
RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle (2608.11241)claude-fable-5, claude-sonnet-5, claude-opus-5technique used90%
Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces (2608.12585)GPT-5.6 Lunaevaluates95%
Enhancing Virtual Agents through SLMs and Edge-Computing: An Exploratory Evaluation of Think and Memory Processes (2608.13420)Qwen 3.8 27Bevaluates98%
Rethinking Normalization Placement for LLMs: Post-Norm under Curriculum Depth Growing (2608.13156)Qwen 3.8 27Bevaluates95%
Jointly Predicting Courses and Grades Using a Transformer-Based Model (2608.13409)trace-supervised symbolic neural CPUtechnique used99%
Explanatory Engagement Under Rare Anomalous Failure: Asymptotic Rarity in Model Behavior (or: The Asymptotic AI) (2608.13063)Qwen 3.8 27Bevaluates99%
ε-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution (2608.12522)AlphaEvolverelated94%
ε-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution (2608.12522)GPT-5.6 Lunaevaluates98%
Governed Persistent Memory: Source-Bound State Semantics and Fail-Closed Release for Long-Horizon Agents (2608.12476)Qwen 3.8 27Bevaluates99%
Privacy-Preserving RAG by Concealing Sensitive Information from External LLMs (2608.12675)Qwen 3.8 27Bevaluates95%
Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence (2608.12928)GPT-5.6 Lunaevaluates99%
From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRL (2608.13787)GPT-5.6 Lunaevaluates95%
Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic Variation (2608.13754)GPT-5.6 Lunaevaluates99%
Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages (2608.14375)GPT-5.6 Lunaevaluates95%
MemoryLake on MemoryArena: A Matched Study of Agent Memory Backends (2608.13883)GPT-5.6 Lunaevaluates95%
Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence (2608.13958)GPT-5.6 Lunaevaluates100%
Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning (2608.14290)Qwen 3.8 Maxrelated95%
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (2608.15089)DeepSeek-V4-Flash-0731evaluates99%
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (2608.15089)GPT-5.6 Lunaevaluates95%
Large Language Models Show Metacognitive Sensitivity in Medical Reasoning (2608.14552)GPT-5.6 Lunaevaluates99%
When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry (2608.14680)DeepSeek-V4-Flash-0731evaluates98%
SKILL: Self-correcting Knowledge-guided Iterative Large Language Model Agent for Logic Optimization (2608.14579)GPT-5.6 Lunatechnique used98%
ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models (2608.15145)GPT-5.6 Lunaevaluates95%
The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning (2608.14558)GPT-5.6 Lunaevaluates98%
The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines (2608.14588)GPT-5.6 Lunaevaluates98%
LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks (2608.14927)GPT-5.6 Lunaevaluates95%
Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability (2608.19338)Qwen 3.8 Maxevaluates98%
Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability (2608.19338)GPT-5.6 Lunaevaluates98%
When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models (2608.19230)GPT-5.6 Lunaevaluates98%
MidTool: Mid-training Data Synthesis for Agentic Tool Use (2608.20314)Qwen 3.8 Maxtechnique used98%
Automatic bioinformatic software named entity recognition from literature (2608.19201)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates90%
Automatic bioinformatic software named entity recognition from literature (2608.19201)Grokevaluates90%
Automatic bioinformatic software named entity recognition from literature (2608.19201)Gemini 3.7 Flashevaluates90%
Automatic bioinformatic software named entity recognition from literature (2608.19201)GPT-5.6 Lunaevaluates90%
Can Conversational AI loosen Us-Versus-Them Boundaries? The Effects of Common, Dual, and Separate Identity Framings on Pro-Immigrant Intergroup Helping (2608.19220)GPT-5.6 Lunatechnique used99%
A Virtual Member of a Community of Practice for the Society of Petroleum Engineers: From Prototype to Deployment (2608.19199)Athena-Brain-8Bevaluates98%
Phantom Gains: Auditing Self-Improvement Against a Measured Null (2608.20290)Qwen 3.8 Maxevaluates98%
ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance (2608.19974)Gemini 3.7 Flashevaluates95%
ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance (2608.19974)DeepSeek-V4-Flash-0731evaluates95%
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents (2608.19861)Gemini 3.7 Flashevaluates99%
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents (2608.19861)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents (2608.19861)GPT-5.6 Lunaevaluates99%
SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning (2608.19842)Qwen 3.8 Maxevaluates98%
Can Agent Memory Systems Track Evolving State? (2608.19652)Qwen 3.8 Maxevaluates98%
Can Agent Memory Systems Track Evolving State? (2608.19652)DeepSeek-V4-Flash-0731evaluates98%
From Retrieved Context to Runtime Control: Adaptive Compression for Edge-based RAG (2608.19535)Qwen 3.8 Maxevaluates99%
Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation (2608.19299)GPT-5.6 Lunaevaluates80%
When Personalization Becomes Bias: Structural and Discursive Religious Framing in AI-Generated Financial Advice (2608.16909)Grokevaluates98%
Different Facets of Verbalised Overconfidence: an Interpretability Study (2608.18106)Qwen 3.8 Maxevaluates99%
DeepTCM1.0: A Multi-Expert AI Agent for Deciphering Mechanisms of Chinese Herbal Formulae Based on General Large Language Models (2608.18103)DeepSeek V4-Flashtechnique used99%
Abliteration Mitigation via Refusal Aliases (2608.18093)Gemma 4evaluates99%
Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities (2608.18090)Gemma 4evaluates85%
Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities (2608.18090)Qwen 3.8 Maxevaluates85%
Nine Emotion Centroids: A Label-Free Valence Axis That Transfers Across Four Modalities (2608.18090)Mistral OCR 4evaluates85%
Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining (2608.18089)Qwen 3.8 Maxevaluates99%
Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining (2608.18089)Mistral OCR 4evaluates99%
Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication (2608.19161)Qwen 3.8 Maxevaluates98%
Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference (2608.18591)Qwen 3.8 Maxtechnique used100%
A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations (2608.18389)Qwen 3.8 Maxevaluates98%
A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations (2608.18389)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates98%
Governance Records as Supervision: Verifier-Selected Self-Training for Structured Workflow Repair (2608.18324)Qwen 3.8 Maxevaluates98%
Efficient Adaptation of LLMs for Hate Speech Detection in Low-Resource Languages: A Comparative Study on Roman Urdu (2608.18142)Mistral OCR 4evaluates99%
Position: Collusion Risks Among AI Reasoning Agents Justify Certification Requirements for Making Market Decisions (2608.18078)DeepSeek V4-Flashevaluates95%
Computational Orientalism: Measuring Structural Discourse Bias in Large Language Models Using the Middle East Cultural Sensitivity Score (MECSS) (2608.18100)GPT-5.6 Lunaevaluates99%
Breaking the weakest link to evade vision language models (2608.18938)Qwen 3.8 Maxevaluates99%
Training-Free Inference-Time Self-Reflection and Cost-Bounded Early Stopping for Large Language Models (2608.18884)Qwen 3.8 Maxevaluates98%
CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence (2608.18613)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates80%
FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents (2608.18423)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates100%
Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme (2608.18336)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates90%
Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme (2608.18336)Qwen 3.8 Maxevaluates98%
Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry (2608.18111)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates80%
Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry (2608.18111)GPT-5.6 Lunaevaluates80%
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents (2608.18307)Qwen 3.8 Maxevaluates99%
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents (2608.18307)Gemini 3.7 Flashevaluates99%
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents (2608.18307)GPT-5.6 Lunaevaluates99%
Potential of ChatGPT in predicting stock market trends based on Twitter Sentiment Analysis (2311.06273)GPT-5.6 Lunaevaluates95%
StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents (2608.18050)GPT-5.6 Lunaevaluates98%
StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents (2608.18050)Gemini 3.7 Flashevaluates98%
Auditing Self-Evolution in Financial Agents: Capability Gains, Security Drift, and Execution-Interface Mismatch (2608.17684)Qwen 3.8 Maxevaluates98%
The Price of Thinking: Reasoning Effort as a Model-Specific API Contract (2608.16956)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates95%
Beyond the Trace: Coupling an Interpretable Reasoning-State Readout to Native MoE Routing (2608.17638)GPT-5.6 Lunaevaluates95%
TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation (2608.17588)GPT-5.6 Lunaevaluates95%
Agent Lightning v1.0: Towards Harnessed Agentic RL (2608.17528)Qwen 3.8 Maxevaluates99%
LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents (2608.17393)Qwen 3.8 Maxevaluates99%
TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration (2608.17336)Qwen 3.8 Maxevaluates98%
SignalReasoner: Assessing the Upper Bound of 3B Models for Signal Mathematical Reasoning (2608.17301)Qwen 3.8 Maxevaluates98%
When Personalization Becomes Bias: Structural and Discursive Religious Framing in AI-Generated Financial Advice (2608.16909)Grok 4.6evaluates99%
When Personalization Becomes Bias: Structural and Discursive Religious Framing in AI-Generated Financial Advice (2608.16909)Gemini 3.7 Flashevaluates98%
When Personalization Becomes Bias: Structural and Discursive Religious Framing in AI-Generated Financial Advice (2608.16909)GPT-5.6 Lunaevaluates98%
FedPref: Federated Preference Learning for Structured Radiology Report Extraction (2608.16971)Qwen 3.8 Maxtechnique used99%
Explicit State Elicitation Is Not Enough: A Controlled Audit of Memory-Policy Classification (2608.17247)GPT-5.6 Lunaevaluates98%
GxP-Agent: Process-DAG Topology for Reliable Clinical Trial Programming with LLM Agents (2608.16890)GPT-5.6 Lunaevaluates99%
GxP-Agent: Process-DAG Topology for Reliable Clinical Trial Programming with LLM Agents (2608.16890)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates99%
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (2608.15089)DeepSeek V4-Flashevaluates99%
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling (2608.15089)GPT-5.6 Solevaluates99%
Does a Tool Result Carry More Authority Than Plain Text? Three Prospective Studies of False-Claim Adoption in a Synthetic Assignment Task with Claude Opus 5 (2608.14992)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates100%
Small Models Scout Bottleneck Order for Large-Model Data Control (2608.14936)Qwen 3.8 Maxevaluates95%
LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks (2608.14927)GPT-5.6 Soltechnique used98%
The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines (2608.14588)Qwen 3.8 Maxevaluates98%
The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines (2608.14588)GPT-5.6 Solevaluates99%
SKILL: Self-correcting Knowledge-guided Iterative Large Language Model Agent for Logic Optimization (2608.14579)Gemini 3.7 Flashtechnique used98%
SKILL: Self-correcting Knowledge-guided Iterative Large Language Model Agent for Logic Optimization (2608.14579)claude-fable-5, claude-sonnet-5, claude-opus-5technique used98%
SKILL: Self-correcting Knowledge-guided Iterative Large Language Model Agent for Logic Optimization (2608.14579)GPT-5.6 Soltechnique used99%
Anatomy of a Quantized Agent: VRAM Stability and Forecasting in Code-Synthesis Agentic Workloads (2608.15117)Qwen 3.8 Maxevaluates99%
When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry (2608.14680)DeepSeek V4-Flashevaluates99%
ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models (2608.15145)GPT-5.6 Solevaluates95%
ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models (2608.15145)GPT-5.6 Soltechnique used95%
The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning (2608.14558)Gemini 3.7 Flashevaluates98%
The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning (2608.14558)GPT-5.6 Solevaluates98%
Large Language Models Show Metacognitive Sensitivity in Medical Reasoning (2608.14552)GPT-5.6 Solevaluates99%
MemoryLake on MemoryArena: A Matched Study of Agent Memory Backends (2608.13883)GPT-5.6 Soltechnique used95%
From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRL (2608.13787)GPT-5.6 Solevaluates99%
Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning (2608.14290)Qwen 3.8 Maxtechnique used85%
Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence (2608.13958)GPT-5.6 Solevaluates99%
Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic Variation (2608.13754)GPT-5.6 Solevaluates98%
Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages (2608.14375)Gemma 4evaluates95%
Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages (2608.14375)GPT-5.6 Solevaluates98%
A Calibrated Test of Internal Action Maps: State Signals Without Global Affine Closure (2608.13626)Qwen 3.8 Maxevaluates98%
Depth-Aware Sensitivity Analysis of Mixture-of-Experts Models via Magnitude-Based Expert Masking (2608.13565)Qwen 3.8 Maxevaluates98%
OrchestraBench: Evaluating Multi-Agent Orchestration Failure Modes, Recovery, and Decomposition Quality (2608.05263)claude-fable-5, claude-sonnet-5, claude-opus-5evaluates90%
NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs (2608.07167)GPT-5.6 Solevaluates99%
ε-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution (2608.12522)AlphaEvolvecites88%
ε-MemEvo: Adaptive Cross-Task Memory Transfer for LLM Program Evolution (2608.12522)GPT-5.6 Solevaluates98%
Don't Want Your LLM to Recommend Nuclear Strike? Try Asking It in Japanese (2608.12373)Gemini 3.7 Flashevaluates98%
knowledge distillationlarge language model safetypublished Aug 25, 2026 · arXiv:2608.21570

A Reproducible, License-Aware Distillation Recipe for CPUDeployable Safety Classification

AI safetyaviation safetypublished Aug 24, 2026 · arXiv:2608.20864

Coverage-Driven Verification for Safety-by-Design in AI-Based Collision Avoidance Systems

LLM safetymulti-turn jailbreakspublished Aug 24, 2026 · arXiv:2608.20820

Certified Multi-Turn Robustness for LLM Safety via Compositional Bounds and Safety Persistence

faithful reasoningabstaining action policiespublished Aug 24, 2026 · arXiv:2608.20670

Why2Speak: Faithful Reasoning for Abstaining Action Policies

LinkedQwen 3.8 Max
large language modelsbenchmarkingpublished Aug 24, 2026 · arXiv:2608.21036

Evaluating Large Language Model Performance on International Maritime Dangerous Goods Code Compliance

semantic camouflage attackslatent intent verificationpublished Aug 24, 2026 · arXiv:2608.20378

Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification

LinkedGemma 4Qwen 3.8 Max
neural network certificationsafety netspublished Aug 21, 2026 · arXiv:2608.20053

On the Applicability of Safety Nets: A Safety-By-Design Solution for Certifying Neural Networks

large language model safetyblack-box safety detectionpublished Aug 21, 2026 · arXiv:2608.19579

Enforcing LLM Safety through DMD-based Classification of Prompt-Response Embedding Dynamics

mechanistic interpretabilityrefusal behaviorpublished Aug 20, 2026 · arXiv:2608.18089

Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining

LinkedQwen 3.8 MaxMistral OCR 4
medication errorsrural healthcarepublished Aug 20, 2026 · arXiv:2608.18135

Improving Rural Medication Safety with AI: A Scoping Review

AI safetysafety alignmentpublished Aug 20, 2026 · arXiv:2608.18131

Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs

large language modelsexplainable AIpublished Aug 19, 2026 · arXiv:2608.18017

Can Large Language Models Explain Flight Safety Events? A Prior-Guided Semantic LLM-based Approach

open-weight language modelssafety alignment removalpublished Aug 19, 2026 · arXiv:2608.17202

Fool's Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight Models

small language modelsAI safety evaluationpublished Aug 19, 2026 · arXiv:2608.17183

Benchmarking the Benchmarks: Evaluating Automated Safety Benchmarks for Small Language Models

aviation safetymachine learningpublished Aug 18, 2026 · arXiv:2608.14746

Advanced modelling and data analytics in aviation

AI safetyAI lock-inpublished Aug 18, 2026 · arXiv:2608.14565

Position: AI Lock-In Is in Progress, and We Must Be Prepared

AI boxinghuman influence and reliancepublished Aug 18, 2026 · arXiv:2608.14795

Individual Disempowerment through an Advice Channel: Control Loss when Influence is Endogenous

UAV/UGV swarmsmulti-modal sensor fusionpublished Aug 17, 2026 · arXiv:2608.14306

Sensor-Driven Mission Synthesis for UAV/UGV Swarms: A TB-CSPN Coordination Architecture with Hardware-Enforced Safety

large language modelsAI safetypublished Aug 17, 2026 · arXiv:2608.14392

Tripwire: Triggering Aligned Refusal via Statistically Certified Safety Neurons

large language model safetysafety classifierspublished Aug 17, 2026 · arXiv:2608.14089

Regime-Conditional Verification: Correctness Estimation for Adapting and Monitoring Safety Classifiers

LLM safetymultilingual evaluationpublished Aug 15, 2026 · arXiv:2608.12373

Don't Want Your LLM to Recommend Nuclear Strike? Try Asking It in Japanese

LinkedGemini 3.7 Flash
AI alignmenthuman reasoningpublished Aug 15, 2026 · arXiv:2608.12372

Position: We Need Practical AI Alignment Methods to Mirror Human Reasoning

moral judgmentethical alignmentpublished Aug 15, 2026 · arXiv:2608.12368

Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments

reinforcement learning from human feedbackConstitutional AIpublished Aug 15, 2026 · arXiv:2608.13345

Rules or Character? Scaling Laws for AI Safety Design

parameter-efficient fine-tuningLoRApublished Aug 15, 2026 · arXiv:2608.13069

Behavioral Reprogramming of Open-Weights Models: Cognitive Plasticity and Alignment Bounds

AI alignmentcensorshippublished Aug 15, 2026 · arXiv:2608.12346

Position: The Alignment Community is Unintentionally Building a Censor's Toolkit

trait-induced safety variationLLM alignmentpublished Aug 13, 2026 · arXiv:2608.11705

Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning

safety alignmentrefusal behaviorpublished Aug 13, 2026 · arXiv:2608.11583

Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

agentic reasoninglocal verificationpublished Aug 13, 2026 · arXiv:2608.11252

Local verification cannot detect non-transportability: a cohomological theory of context preservation in agentic reasoning

semantic safety constraintssingular learning theorypublished Aug 13, 2026 · arXiv:2608.11243

The Off-Support Barrier: Why Semantic Safety Constraints Are Not Learning-Problem Invariants, and What Follows for Prior Design, Containment, and Verification

activation steeringlanguage model safetypublished Aug 13, 2026 · arXiv:2608.11227

Forecasting Side Effects of Activation Steering

AI alignmentAI safetypublished Aug 12, 2026 · arXiv:2608.10327

Toward a Theory of Value in AI Alignment

large language modelspost-trainingpublished Aug 12, 2026 · arXiv:2608.10209

Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes

LLM securityred teamingpublished Aug 12, 2026 · arXiv:2608.10171

Generating Attacks for LLMs with GFlowNets

large language modelsgroup decision-makingpublished Aug 11, 2026 · arXiv:2608.08199

Persuasive and Compliant Tendencies Predict Group Decision-Making in Humans and Language Models

multilingual AI safetymechanistic interpretabilitypublished Aug 11, 2026 · arXiv:2608.08032

Decided Upstream, Written Late: Locating and Pricing the Cross-Lingual Refusal Circuit of a Multilingual MoE

large language model alignmenthuman valuespublished Aug 11, 2026 · arXiv:2608.07642

Contextual Value Alignment via Multilayer Combinatorial Fusion

value alignmentlarge language modelspublished Aug 10, 2026 · arXiv:2608.07367

People Are Not Just Their Countries. Disentangling Social Determinants of LLM Value Alignment Across Europe

course overlap detectioncurriculum alignmentpublished Aug 7, 2026 · arXiv:2608.05910

CourseGraph: Finding overlaps and differences in Computer Science courses across universities

defence ontologiesnational security ontologiespublished Aug 7, 2026 · arXiv:2608.05867

Improving Interoperability among Defence and National Security Ontologies: Analysis and Evaluation Tasks

item response theorylanguage model safetypublished Aug 6, 2026 · arXiv:2608.05086

Item Response Theory for AI Safety

aviation safetyhazard scenario generationpublished Aug 6, 2026 · arXiv:2608.04697

Traceable LLM-Generated Hazard Scenarios for Operational Safety Analysis of Aviation Systems Using ASRS Reports

safety guardsharmful-content detectionpublished Aug 5, 2026 · arXiv:2608.03201

When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

medical AI evaluationmedication safetypublished Aug 5, 2026 · arXiv:2608.03028

Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning

AI alignmentvalue learningpublished Aug 3, 2026 · arXiv:2607.28881

Fragility of Value under Imperfect Alignment

large language modelsclinical triagepublished Aug 3, 2026 · arXiv:2607.28677

Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support

on-policy distillationmodel realignmentpublished Jul 31, 2026 · arXiv:2607.27081

On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment

automated red teamingprompt injectionpublished Jul 31, 2026 · arXiv:2607.26115

GPT-Red: Automated Red Teaming via Self-Play at Scale

value alignmentpersonalizationpublished Jul 30, 2026 · arXiv:2607.24782

Personalization, Personas, and Forecasting in Value Alignment

in-context schemingAI alignmentpublished Jul 30, 2026 · arXiv:2607.24769

LLM Scheming Inversely Scales with Pretraining Language Coverage

DMAPOmulti-evaluator agreementpublished Jul 30, 2026 · arXiv:2607.25136

Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization

conversational AIuser well-beingpublished Jul 30, 2026 · arXiv:2607.25057

Psychological Influences of Conversational AI: Research and Design Directions for Reducing Harm and Promoting Well-Being

alignment fakingevaluation-conditioned behaviorpublished Jul 30, 2026 · arXiv:2607.24758

Do Models Fake Alignment Without Clear Consequences?

pretrainingsupervised fine-tuningpublished Jul 30, 2026 · arXiv:2607.25063

Similar Models Learn Differently: Final-Window Pretraining Shapes Post-Training Beyond SFT

post-trainingsupervised fine-tuningpublished Jul 28, 2026 · arXiv:2607.22676

How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift

AI safetybenchmarkingpublished Jul 28, 2026 · arXiv:2607.22671

AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models

high-temperature samplingrefusal behaviorpublished Jul 24, 2026 · arXiv:2607.20791

Refusal-Gated Decoding: Preserving Refusal Behavior Under High-Temperature Sampling

LLM alignmentregex filteringpublished Jul 24, 2026 · arXiv:2607.20494

Isolating LLM Alignment from Regex: Zero Coverage and Metric-Dependent Divergence Under Adversarial Mutation

reinforcement learning from human feedbackpreference optimizationpublished Jul 24, 2026 · arXiv:2607.20515

Reliability-Aware LLM Alignment from Inconsistent Human Feedback

LLM-generated codesoftware verificationpublished Jul 24, 2026 · arXiv:2607.20852

Code Monitor Red Teaming for Public-Test-Passing Code

incomplete prompt jailbreaksharmful content safeguardspublished Jul 24, 2026 · arXiv:2607.20473

Incomplete Prompt Jailbreaks in Large Language Models

language-model evaluationuser expectationspublished Jul 24, 2026 · arXiv:2607.20485

Expectation Alignment of Language Models for Real-World User Expectations

multi-turn attacksjailbreak robustnesspublished Jul 24, 2026 · arXiv:2607.20472

Robust Critics: Defending LLMs Against Multi-Turn Attacks

AI safetyjailbreak attackspublished Jul 23, 2026 · arXiv:2607.19424

JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models

conversational risk accumulationstateful guardrailspublished Jul 23, 2026 · arXiv:2607.19361

Stateful Guardrails for Multi-Turn LLM Systems: A Conversational Risk Accumulation Framework

sparse autoencodershidden-space geometrypublished Jul 23, 2026 · arXiv:2607.19366

Geometry-Guided Constraint Learning for LLM Safety Classification

medical AIclinical conversationpublished Jul 22, 2026 · arXiv:2607.18828

Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety

AI safetyLLM guardrailspublished Jul 22, 2026 · arXiv:2607.18268

Fence: Specialized SLM Guardrails for LLM Applications

dual-hypothesis reasoningmulti-component supervised fine-tuningpublished Jul 21, 2026 · arXiv:2607.17575

A Dual-Hypothesis Reasoning Framework for LLM Guardrails

task alignmentpartially observable Markov decision processespublished Jul 21, 2026 · arXiv:2607.16412

Interactive Task Alignment as a POMDP

AI safetycapability thresholdspublished Jul 20, 2026 · arXiv:2607.16112

Harmonizing AI Safety Thresholds

multi-agent systemsAI safetypublished Jul 20, 2026 · arXiv:2607.15434

Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation

AI alignmenthuman-AI interactionpublished Jul 17, 2026 · arXiv:2607.14240

Align AI to Dynamic Human-AI Workflows

medical AI benchmarksAI safety boundariespublished Jul 17, 2026 · arXiv:2607.15166

MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection

contemplative principleslarge language model alignmentpublished Jul 14, 2026 · arXiv:2607.10871

Toward Contemplative LLM: A Modular Framework for Evaluating and Enhancing LLM Alignment in Mental Health

sparse autoencodersmechanistic interpretabilitypublished Jul 14, 2026 · arXiv:2607.10226

When Are Sparse Feature Interventions Actually Localized? Matched Evaluation for SAE-Based Safety Control

latent adversarial trainingjailbreak robustnesspublished Jul 10, 2026 · arXiv:2607.07918

Efficient Safety Alignment of Language Models via Latent Personality Traits

large language modelsmental health supportpublished Jul 10, 2026 · arXiv:2607.07766

Alignment Plausibility: A New Standard for Assuring AI in Healthcare

mechanistic interpretabilitylarge language model securitypublished Jul 10, 2026 · arXiv:2607.07903

Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs

chain-of-thought monitoringAI agent safetypublished Jul 10, 2026 · arXiv:2607.08066

Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring

differential diagnosisclinical reasoningpublished Jul 10, 2026 · arXiv:2607.08038

A safety-oriented hypothetico-deductive framework for AI-assisted differential diagnosis

chain-of-thought reasoningreasoning faithfulnesspublished Jul 9, 2026 · arXiv:2607.07229

Reasoning Consistency Scanning: A Framework for Auditing Chain-of-Thought Validity in AI Safety Evaluations

AI-generated child sexual abuse materialchild safetypublished Jul 8, 2026 · arXiv:2607.05407

Position: Preventing AI-Generated CSAM Necessitates New Approaches to AI Safety

autonomous drivingend-to-end learningpublished Jul 8, 2026 · arXiv:2607.06328

Driving the Wrong Way: Leveraging Interpretability in End2End Autonomous Driving Models

AI safetycontent moderationpublished Jul 8, 2026 · arXiv:2607.06326

DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

biosecurityrefusal behaviorpublished Jul 8, 2026 · arXiv:2607.05462

Evaluating calibrated refusal and safe usefulness in dual-use biology settings

reinforcement learningconstructive safety alignmentpublished Jul 7, 2026 · arXiv:2607.02914

Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models