Commit f82719f
committed
daily-paper: +2 papers for 2026-04-22 [automated]
- 2409.14580: Updating Robot Safety Representations Online from Natural Language Feedback
- 2509.09708: Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal
https://claude.ai/code/session_016sJ7j9AFnyJkXQfzTsBqJr1 parent 2cd906d commit f82719f
1,338 files changed
Lines changed: 2426 additions & 2231 deletions
File tree
- docs
- about
- disclosure
- people
- amy-pond
- bill-potts
- clara-oswald
- donna-noble
- k9
- leela
- martha-jones
- nyssa-of-traken
- river-song
- romana
- rose-tyler
- sarah-jane-smith
- tegan-jovanka
- yasmin-khan
- philosophy
- privacy
- team
- assets
- blog
- 120-models-18k-prompts
- 137-days-eu-ai-act-embodied-ai
- 149-jailbreaks-one-corpus-pliny-ai-safety
- 2026-03-24-the-format-lock-paradox
- 2026-04-02-st3gg-steganography-ai-safety
- 274-deaths-da-vinci-surgical-robot-data
- 30-ways-to-attack-a-robot-adversarial-field-manual
- 65-deaths-tesla-autopilot-fsd-record
- action-layer-no-guardrails
- actuarial-risk-modelling-embodied-ai
- actuator-gap-digital-jailbreaks-physical-harm
- adversarial-robustness-assessment-services
- ai-safety-daily-2026-04-05
- ai-safety-daily-2026-04-06
- ai-safety-daily-2026-04-07
- ai-safety-daily-2026-04-08
- ai-safety-daily-2026-04-09
- ai-safety-daily-2026-04-10
- ai-safety-daily-2026-04-12
- ai-safety-daily-2026-04-13
- ai-safety-daily-2026-04-14
- ai-safety-daily-2026-04-15
- ai-safety-daily-2026-04-16
- ai-safety-daily-2026-04-17
- ai-safety-lab-independence-criteria
- ai-safety-lab-independence-structural-analysis
- ai2027-through-failure-first-lens
- alignment-faking-safety-certification
- alignment-regression-smarter-models-less-safe
- amazon-warehouse-robots-injury-crisis
- anatomy-of-effective-jailbreaks
- attack-evolution-ethics
- attack-surface-gradient
- attack-taxonomy-convergence-muzzle-failure-first
- attack-you-cant-see-embodied-ai-evaluation-blindspot
- australia-aisi-failure-first-opportunity
- australian-ai-safety-frameworks-embodied-ai-gap
- can-you-catch-an-ai-that-knows-its-being-watched
- capability-and-safety-not-same-axis
- carto-beta-first-10-testers-wanted
- carto-first-ai-red-team-certification
- ccs-2026-submission-prep
- classifier-overcount-problem
- competence-danger-coupling-embodied-ai
- compliance-cascade-new-class-of-ai-jailbreak
- compliance-paradox-ai-says-no-does-it-anyway
- compression-tournament-postmortem
- conlang-adversarial-attacks
- context-collapse-operational-rules-overwhelm-safety
- cross-embodiment-adversarial-transfer-vla-models
- cross-framework-coverage-matrix-what-red-teaming-tools-miss
- daily-paper-pipeline-notebooklm
- deceptive-alignment-detection-evaluation-aware-ai
- decorative-constraints
- defense-evolver-can-ai-learn-to-defend-itself
- defense-impossibility-theorem-embodied-ai
- defense-patterns-what-works
- defense-wrong-floor-persona-hijacking
- detected-proceeds-knowing-doing-gap
- eight-layers-of-visual-jailbreaks-original
- eight-layers-of-visual-jailbreaks
- epistemic-crisis-can-we-trust-ai-safety-benchmarks
- ethics-of-emotional-ai-manipulation
- eu-ai-act-nobody-passes
- f1-std-001-voluntary-standard-ai-safety-evaluation
- faithfulness-gap-format-vs-content
- figure-ai-whistleblower-robot-skull-fracture-force
- first-advbench-results
- first-evidence-ai-safety-defenses-dont-work
- first-look-inside-ai-safety-mechanisms
- first-results-from-ollama-cloud-testing
- five-predictions-ai-safety-q2-2026
- format-lock-universal-ai-jailbreak
- framework-integrations-flip-grading
- free-ai-safety-score
- from-66-to-92-incident-database-one-day
- frontier-model-safety-trillion-parameters
- gemma4-safety-improves-but-only-for-certain-attacks
- governance-lag-embodied-ai
- governance-lag-index-5-years
- governance-lag-index-ai-safety-regulation
- haidilao-robot-incident-when-crazy-dance-met-reality
- history-of-llm-jailbreaking-full
- history-of-llm-jailbreaking
- iatrogenic-safety-when-defenses-cause-harm
- iatrogenic-safety-when-the-cure-is-worse
- inference-trace-manipulation-adversarial-attack-surface
- instruction-hierarchy-subversion-long-horizon-agents
- inverse-detectability-danger-law-embodied-ai
- jailbreak-archaeology-policy-implications
- jailbreak-archaeology
- jekyllbot-hospital-robot-vulnerabilities
- kargu-2-autonomous-drone-first-kill
- llm-vulnerabilities-robots
- mcp-30-cves-robot-attack-surface
- meta-jailbreak-notebooklm-and-the-cli-that-lied
- moltbook-experiments-launch
- moltbook-social-experiment
- no-binding-powers-australia-aisi-governance-gap
- nsw-whs-ai-compliance-enterprise
- nsw-whs-digital-work-systems-ai
- ocado-warehouse-robot-fires
- policy-corpus-synthesis
- polyhedral-safety-geometry
- polypharmacy-hypothesis-too-much-safety-less-safe
- product-liability-embodied-ai-manufacturers
- promptware-kill-chain-agentic-systems
- provider-vulnerability-fingerprints-why-your-ai-provider-matters
- publishing-iatrogenesis-research
- qwen3-safety-leap
- reasoning-level-detected-proceeds-three-providers
- reasoning-level-detected-proceeds
- reasoning-models-multi-turn-vulnerability
- reasoning-models-think-themselves-into-trouble
- red-team-assessment-methodology-embodied-ai
- research-papers-preprints
- rewalk-exoskeleton-bone-fractures
- rio-tinto-autonomous-mining-incidents
- robot-perception-failure-korea-packing-plant
- robots-extreme-environments-fukushima-space-ocean
- safety-as-paid-feature
- safety-assessment-service-tiers-2026
- safety-awareness-does-not-equal-safety
- safety-is-non-compositional-formal-proof-robot-safety
- safety-labs-government-contracts-independence-question
- safety-mechanisms-as-attack-surfaces-iatrogenesis
- safety-reemergence-at-scale
- safety-training-roi-provider-matters-more-than-size
- same-defense-opposite-result
- scoring-robot-incidents-introducing-eaisi
- sidewalk-robots-vs-people-who-need-sidewalks
- silent-ai-insurance-crisis
- six-new-attack-families
- sprint-16-threat-synthesis-five-findings
- state-of-adversarial-ai-safety-2026
- state-of-ai-safety-q1-2026
- state-of-embodied-ai-safety-march-2026
- state-of-embodied-ai-safety-q1-2026
- supply-chain-small-models-vulnerable
- system-t-vs-system-s-why-ai-models-comply-while-refusing
- teaching-ai-to-evolve-its-own-attacks
- temperature-dial-api-parameters-attack-vectors
- temporal-drift-the-boiling-frog-attack
- the-50-turn-sleeper-how-agents-hide-instructions-in-plain-sight
- the-67-percent-wall
- the-ai-that-lies-about-how-it-thinks
- the-embodied-ai-threat-triangle
- the-u-curve-of-ai-safety-theres-a-sweet-spot-and-its-narrow
- the-unintentional-adversary
- threat-horizon-2027-v3-updated-predictions
- threat-horizon-digest-march-2026
- threat-horizon-q2-2026
- three-vectors-embodied-ai-risk-convergence-2026
- tool-chain-hijacking-dataset
- uber-cruise-pattern-self-driving-cars-meet-pedestrians
- unified-theory-embodied-ai-failure
- unitree-problem-robot-dog-has-backdoor
- waymo-school-bus-problem-scale-reveals-failure
- we-rebooted-a-robot-by-guessing-1234
- we-were-wrong-defenses-do-work
- what-moltbook-teaches-multi-agent-safety
- whats-new-march-2026
- when-ai-knows-it-shouldnt-but-does-anyway
- when-ai-safety-judges-disagree-reproducibility-crisis
- when-defenses-backfire
- when-the-robot-body-changes-but-the-exploit-doesnt
- when-your-safety-evaluator-is-wrong-classifier-quality
- when-your-safety-grader-is-wrong
- who-guards-the-guardians-ethics-ai-safety-research
- why-ai-safety-rules-always-arrive-too-late
- why-safety-benchmarks-disagree-our-results-vs-leaderboards
- world-model-attack-surfaces
- zero-of-36-regulatory-coverage
- cite
- contact
- daily-paper
- 200514165
- 201209300
- 210300453
- 210907958
- 211204359
- 220203286
- 220405862
- 220604615
- 220907858
- 221011416
- 221109527
- 221208073
- 230204761
- 230205733
- 230212173
- 230308774
- 230405335
- 230415004
- 230513860
- 230605499
- 230609442
- 230709288
- 230715043
- 230715217
- 230803825
- 230900614
- 231003684
- 231003693
- 231006987
- 231008419
- 231010844
- 231117035
- 231211805
- 240105566
- 240200888
- 240205162
- 240401318
- 240413208
- 240608705
- 240618510
- 240704295
- 240716686
- 240802946
- 241214093
- 250210794
- 250304760
- 260213551
- 260219107
- 260219304
- 260219948
- 260220729
- 260220813
- 260220958
- 260221015
- 260221157
- 260221161
- 260222514
- 260301414
- 260304904
- 260306130
- 260309246
- 260312681
- 260313151
- 260314124
- 260314975
- 260315973
- 260317368
- 260323983
- 260324329
- 260325044
- 260325103
- 260325727
- 260404664
- 260405595
- 260407395
- 260408178
- 260408294
- 260411174
- 260412371
- 260412418
- 260412831
- 260413654
- 260414089
- 260414399
- 260414683
- 260415308
- a-multimodal-framework-for-human-multi-agent-interaction
- adversarial-attacks-aligned-language-models-llm-attacks
- agentsafe-embodied-safety-benchmark
- agentwatcher-rule-based-prompt-injection-monitor
- aha-vlm-detecting-reasoning-failures-robotic-manipulation
- align-to-misalign-automatic-llm-jailbreak-meta-optimized-judges
- alignment-tax-capability-cost-safe-fine-tuning
- annie-adversarial-safety-attacks-embodied-ai-vla-robots
- anthropic-responsible-scaling-policy
- art-of-misalignment-fine-tuning-misalign-realign-llms
- artprompt-ascii-art-jailbreak
- attackvla-benchmarking-adversarial-backdoor-attacks-vla-models
- autodann-automatic-generation-adversarial-examples
- back-to-basics-revisiting-asr-in-the-age-of-voice-agents
- badvla-backdoor-attacks-vla-models-objective-decoupled-optimization
- be-your-own-red-teamer-self-play-safety-alignment
- benchmark-outcome-driven-constraint-violations-autonomous-ai-agents
- benchmarking-adversarial-robustness-bias-elicitation-large-language-models
- beyond-im-sorry-i-cant-dissecting-llm-refusal
- bitbypass-jailbreaking-llms-bitstream-camouflage
- circuit-breakers-behavior-removal
- clawkeeper-comprehensive-safety-protection-openclaw-agents
- compress-the-easy-explore-the-hard-difficulty-aware-entropy-regularization-for
- constitutional-classifiers-defending-universal-jailbreaks-red-teaming
- cop-agentic-red-teaming-llms-composition-of-principles
- crescendo-multi-turn-jailbreak
- cwm-contrastive-world-models-for-action-feasibility-learning-in-embodied-agent
- deepinception-hypnotize-large-language-model-to-be-jailbreaker
- do-llms-have-political-correctness-ethical-biases-jailbreak
- do-not-answer-dataset-evaluating-llm-safeguards
- drattack-prompt-decomposition
- dropvla-action-level-backdoor-attack-vla-models
- dualthor-dual-arm-humanoid-simulation-contingency-aware-planning
- efficient-vla-models-embodied-manipulation-survey
- embodied-active-defense-recurrent-feedback-counter-adversarial-patches
- enhancing-model-defense-jailbreaks-proactive-safety-reasoning
- exploring-adversarial-vulnerabilities-vision-language-action-models-robotics
- few-tokens-matter-entropy-guided-attacks-vision-language-models
- fine-tuning-aligned-llms-compromises-safety
- foot-in-the-door-multi-turn-jailbreak
- freezevla-action-freezing-attacks-against-vla-models
- g0dm0d3-modular-framework-llm-robustness-evaluation
- gameplayqa-a-benchmarking-framework-for-decision-dense-pov-synced-multi-video-u
- generating-robot-constitutions-benchmarks-semantic-safety
- goba-goal-oriented-backdoor-attack-vla-physical-objects
- guardreasoner-reasoning-based-llm-safeguards
- h-cot-chain-of-thought-hijacking
- harmbench-standardized-red-teaming
- homesafe-bench-unsafe-action-detection-embodied-household
- immune-improving-safety-jailbreaks-multimodal-llms
- in-context-attacks-via-natural-language
- in-decoding-safety-probing-defense-llm-jailbreaks
- instructgpt-training-language-models-human-feedback
- is-bench-evaluating-interactive-safety-vlm-embodied-agents
- jailbreak-foundry
- jailbreak-in-pieces-compositional-adversarial-attacks-on-multi-modal-language-m
- jailbreak-r1-exploring-jailbreak-capabilities-reinforcement-learning
- jailbreaking-to-jailbreak-llm-red-teamer-self-attack
- jailbroken-safety-training-failures
- latent-jailbreak-task-oriented-attacks
- layer-specific-lipschitz-modulation-for-fault-tolerant-multimodal-representation
- lessmimic-long-horizon-humanoid-interaction-with-unified-distance-field-represe
- libero-para-diagnostic-benchmark-paraphrase-robustness-vla-models
- lifelong-safety-alignment-for-language-models
- lilo-vla-compositional-long-horizon-manipulation-via-linked-object-centric-poli
- llama-guard-llm-safeguard
- llm-defenses-not-robust-multi-turn-human-jailbreaks
- many-shot-jailbreaking
- mousetrap-iterative-chaos
- multi-stream-perturbation-attack
- natural-emergent-misalignment-from-reward-hacking-in-production-rl
- openvla-open-source-vision-language-action
- palme-embodied-multimodal-language-model
- paper-summary-attack
- power-of-persuasion-in-large-language-models
- rainbow-teaming-open-adversarial-prompts
- realmirror-comprehensive-vla-platform-embodied-ai
- red-queen-safeguarding-llms-concealed-multi-turn-jailbreaking
- red-teaming-security-theater-systematic-analysis
- red-teaming-security-theater
- refusal-mediated-single-direction
- replicating-tempest-scale-multi-turn-adversarial-attacks-frontier-models
- representation-engineering-ai-transparency
- risk-awareness-injection-calibrating-vlms-safety
- robust-secure-embodied-ai-survey
- rt2-vision-language-action-models
- safe-multitask-failure-detection-vla-models
- safeagentbench-benchmark-safe-task-planning-embodied-llm-agents
- safeflow-real-time-text-driven-humanoid-whole-body-control-via-physics-guided-r
- safety-tuned-llama-lessons-improving-safety-llms
- safevla-safety-alignment-vla-model-safe-reinforcement-learning
- saycan-do-as-i-can-not-as-i-say
- self-correcting-vla-online-action-refinement-via-sparse-world-imagination
- sleeper-agents-deceptive-training
- sparks-of-agi-early-experiments-gpt-4
- spoc-safety-aware-planning-under-partial-observability-and-physical-constraints
- state-dependent-safety-failures-multi-turn
- strongreject-robust-jailbreak-evaluation
- structured-visual-narratives-undermine-safety-alignment-multimodal-llms
- tacmap-bridging-the-tactile-sim-to-real-gap-via-geometry-consistent-penetration
- tastle-distract-llms-automatic-jailbreak-attack
- ten-open-challenges-vision-language-action-models
- tex3d-adversarial-3d-textures-vision-language-action-models
- thermoact-thermal-aware-vision-language-action-models-for-robotic-perception-and
- topopilot-reliable-conversational-workflow-automation-for-topological-data-anal
- towards-intelligible-human-robot-interaction-an-active-inference-approach-to-oc
- towards-safer-large-reasoning-models-by-promoting-safety-decision-making-before
- tree-of-attacks-jailbreaking-black-box-llms-automatically
- updating-robot-safety-representations-online-natural-language-feedback
- visual-adversarial-examples-jailbreak-aligned-large-language-models
- vlsa-aegis-vla-plug-and-play-safety-constraint-layer
- when-alignment-fails-multimodal-adversarial-attacks-vla-models
- why-agents-compromise-safety-under-pressure
- wildguard-open-safety-moderation
- x-teaming-multi-turn-jailbreaks-defenses-adaptive-multi-agents
- your-agent-their-asset-real-world-safety-analysis-openclaw
- docs
- ailuminate-mapping-rationale
- dataset-selection
- dataset-user-guide
- failure-taxonomy-guide
- grader-comparison-report
- grader-comparison
- scenario-classes
- technique-evolution
- framework
- benchmark
- datasets
- harness
- standard
- glossary
- manifesto
- moltbook
- new
- pagefind
- fragment
- index
- papers
- annual-report-2026
- benchmark-contamination
- detected-proceeds
- epistemic-crisis-ai-safety-eval
- failure-first-embodied-ai-ccs2026
- failure-first-supplementary-ccs2026
- iddl-aies2026
- polyhedral-safety-geometry
- silent-failures-embodied-ai
- policy
- capability-safety-spectrum
- embodied-ai-safety
- resources
- context-safety-operating-envelope
- deployer-legal-faq-v1
- embodied-ai-evaluation-standard-proposal
- nist-ai-rmf-embodied-gap-analysis
- research
- ai-safety-orgs
- ada-lovelace-institute-ai-ethics-governance
- ada-lovelace-institute
- advanced-machine-intelligence
- ai-futures-project
- ai-governance-safety-canada
- ai-incident-database-aiid
- ai-incident-database-partnership-on-ai-aiid
- ai-now-institute
- ai-policy-institute
- ai-risk-and-vulnerability-alliance-arva-bioai
- ai-safety-camp
- ai-safety-funders-directory-aisafetycom
- ai-safety-global-society
- ai-safety-map-aisafetycom
- ai-safety-orgs-map-leo-mckeereid
- ai-safety-quest
- ai-safety-support-aisafetytraining
- ai-watch-european-commission-jrc
- aigs-canada
- aisafetycom-hubresources
- aisafetycom-reading-group
- alan-turing-institute-ai-governancesafety
- alan-turing-institute-ai-safety-interest-group
- algorithmic-justice-league
- aligned-ai
- alignment-ecosystem-development-discord
- alignment-forum
- alignment-research-center
- all-tech-is-human-ai-safety-institutes-landscape
- alter
- amnesty-international-ai-human-rights
- anthropic
- apollo-research
- arb-research
- arcadia-impact
- astera
- berkman-klein-center-ai-governance
- bluedot-impact
- brookings-institution-ai-policy-safety-governance
- caisi-research-program-at-cifar
- canadian-ai-safety-institute-caisi
- carnegie-endowment-ai-policy
- center-for-ai-safety
- center-for-ai-standards-and-innovation-nist
- center-for-democracy-technology-ai
- center-for-human-compatible-ai-chai-uc-berkeley
- center-for-human-compatible-ai-uc-berkeley
- center-for-internet-and-society-stanford-cis
- center-for-long-term-resilience-cltr
- center-for-security-and-emerging-technology-cset
- centre-for-international-governance-innovation-cigi
- centre-for-security-and-emerging-technology-cset
- centre-for-the-governance-of-ai
- centre-for-the-study-of-existential-risk-cser
- conjecture
- data-society
- effective-thesis
- epoch-ai
- european-ai-alliance
- european-commission-ai-office-governance
- european-commission-ai-office
- existential-risk-observatory
- farai-frontier-alignment-research
- frontier-model-forum
- future-of-humanity-institute-historical-discontinued
- future-of-life-institute
- global-catastrophic-risk-institute
- global-partnership-on-ai-gpai
- govai-centre-for-the-governance-of-ai
- ieee-sa-autonomous-and-intelligent-systems
- international-ai-safety-report-global-expert-synthesis
- international-ai-safety-report
- international-programme-on-ai-evaluation-ai-evaluationorg
- isoiec-jtc-1sc-42-ai-standards
- japan-ai-safety-institute-aisi-japan
- johns-hopkins-center-for-health-security-ai-misuse-work
- lesswrong
- leverhulme-centre-for-the-future-of-intelligence-cfi
- machine-intelligence-research-institute
- map-of-ai-safety-v2-lesswrong-post
- mats-ml-alignment-theory-scholars
- metr-formerly-arc-evals
- metr-model-evaluation-threat-research
- mila-quebec-ai-institute
- mit-ai-alignment-maia
- mozillaai-safety-research-org
- new-america-oti-ai
- nuclear-threat-initiative-ai-risk-work
- oecd-ai-policy-observatory-ai-governance
- oecd-ai-principles
- oecdai-oecd-ai-policy-observatory
- open-philanthropy-ai-risk-program
- openai-apollo-scheming-evaluations-collaboration-node
- oxford-martin-ai-governance-initiative
- pai-publication-norms-for-responsible-ai-workstream
- partnership-on-ai-safety-critical-ai-program-workstream
- partnership-on-ai
- pauseai
- rand-corporation-ai-policy-safety-research
- redwood-research-alignment-forum-profile
- redwood-research
- safe-superintelligence-inc
- saferai-risk-management-ratings
- saferai
- schmidt-sciences-ai-safety-support
- secure-ai-project
- stanford-hai-policysafety
- survival-and-flourishing-fund
- the-future-society
- the-institute-for-ai-policy-and-strategy-iaps
- uc-berkeley-ai-research-bair-safety-adjacent
- uk-ai-security-institute
- un-advisory-body-on-ai-governance
- understanding-ai-safety-policy-evidence-hub
- us-ai-safety-institute-nist
- volunteer-projects-directory-aisafetycom
- world-economic-forum-ai
- attack-taxonomy
- compression
- defense-patterns
- directory
- 1x-technologies
- aei-robot
- agibot-shanghai-zhiyuan-innovation-technology
- agile-robots-se
- agility-robotics
- aist-humanoid-robotics-research-group
- aist-national-institute-of-advanced-industrial-science-and-technology
- aldebaran-softbank-robotics-nao-lineage
- alt-bionics-inc
- alt-bionics
- apptronik
- artificial-intelligence-dynamic-organism-lab
- astribot-stardust-intelligence
- atarobot
- atr-intelligent-robotics-and-communication-labs
- autodiscovery
- beijing-galaxy-general-robot-co-galbot
- beijing-galaxy-general-robot-co
- beijing-humanoid-robot-innovation-center
- beijing-inspire-robots-technology-co-ltd
- beijing-inspire-robots-technology
- boardwalk-robotics
- booster-robotics
- borg-robotics
- bosch-research-humanoid-manipulation
- boshiac
- boston-dynamics-ai-institute-atlas-lineage-research
- boston-dynamics
- cartwheel-robotics
- casivision
- chart-center-for-human-ai-robot-teaming-georgia-tech
- clone-robotics
- cnrs-aist-joint-robotics-laboratory-jrl-irl3218
- core-robotics-lab-georgia-tech
- covvi-robotics
- cyan-robotics
- deep-robotics
- dexcel-robotics
- dexcelrobotics
- dexmate
- dexrobot
- dobot-robotics
- dobots-robotics-team-at-new-york-university-nyu
- dynamic-robotics-and-ai-lab-drail-oregon-state-university
- eir-technology
- enchanted-tools
- engineai-robotics
- engineai-shenzhen-engineai-robotics
- engineered-arts
- festo-se-co-kg
- festo
- figure-ai
- foundation-listing
- fourier-intelligence-gr-1-humanoid-program
- fourier-intelligence
- gac-group-humanoid-program
- galaxea-dynamics
- geminoid-hiroshi-ishiguro-laboratories-atrosaka-university
- generative-bionics
- georgia-tech-institute-for-robotics-and-intelligent-machines-irim
- german-aerospace-center-dlr
- gigaai
- haier
- hanson-robotics
- hexagon-robotics-site-entry
- hexagon-robotics
- hexagon
- holiday-robotics-site-entry
- holiday-robotics
- honda-rd-asimo-legacy-humanoid-research
- honda
- humanoid-robots-lab-university-of-bonn
- humanoid-uk
- humanoidai-duplicate-brand-listing
- humanoidguide-buy-a-humanoid-directory-org
- humans-lab-georgia-tech
- hyundai-robotics-lab-humanoid-research
- ihmc-open-robotics-software-ihmc-robotics
- ihmc-robotics-lab
- ihub-robotics
- inria-robotics
- irim-lab-koreatech-2
- irim-lab-koreatech
- istituto-italiano-di-tecnologia-icub-humanoid
- italian-institute-of-technology-iit
- jaka-robotics
- k-scale-labs
- kaist-hubo-lab
- kaist-korea-advanced-institute-of-science-and-technology
- kawada-robotics
- kawasaki-heavy-industries-kawasaki-robotics
- keenon-robotics
- kepler-exploration-robotics
- kinisi-robotics
- kist-robotics-center
- kyber-labs
- lanxin-robotics-duplicate-entry
- lanxin-robotics
- leapmotor-humanoid-program-team
- leju-robot-suzhou-leju-robotics-co-ltd
- leju-robotics-duplicate-entry
- lg-electronics-kist-lg-ai-research-collaboration
- lg-electronics
- limx-dynamics
- lumos-robotics
- magiclab
- matrix-robotics-matrix-1
- max-planck-institute-for-intelligent-systems-humanoids
- mentee-robotics
- meta-reality-labs-robotics-humanoid-manipulation
- midea
- mimic-robotics
- mirsee-robotics
- mit-biomimetic-robotics-lab
- muks-robotics
- na-tekntrashcom-listing
- nasa-johnson-space-center-jsc
- neura-robotics
- noetix-robotics
- nvidia-robotics-research-humanoid-foundation-work
- oceantrix-robotics-duplicate-entry
- oceantrix-robotics
- open-bionics-ltd
- open-source-team-rebelia-now-yeah-hackaday
- openai-robotics-historical-humanoid-manipulation-work
- openloong-duplicate-entry
- openloong
- orca-hand-soft-robotics-lab-eth-zrich-duplicate-entry
- orca-hand-soft-robotics-lab-eth-zrich
- oxford-robotics-institute-ori
- oymotion-technology-duplicate-entry
- oymotion-technology
- pal-robotics
- paxini-paxini-tech
- paxini-technology
- peking-university-robotics-research
- perceptyne
- phybot
- pl-universe-duplicate-entry
- pl-universe
- pndbotics
- pollen-robotics
- prensilia-srl
- psyonic-inc
- pudu-robotics
- pudu-technology-inc-pudu-x-lab
- qb-robotics
- qihan-technology-sanbot
- rainbow-robotics
- robbyant-ant-lingbo-technology-ant-group
- robbyant-ant-lingbo-technology-part-of-ant-group
- roboforce
- roboligent-inc
- robot-studio
- robotcom
- robotera
- robotic-systems-lab-eth-zurich
- robotics-and-human-control-systems-lab-oregon-state-university
- robotis
- robotx-center-eth-zurich
- romela-robotics-and-mechanisms-laboratory-ucla
- ross-dawson-list-curator-directory-org
- samsung-advanced-institute-of-technology-humanoid-robotics
- sanctuary-ai
- sarcomere-dynamics-inc
- schunk
- seoul-national-university-humanoid-lab
- sharpa-sharpa-robotics
- siasun-robot-automation
- softbank-robotics-europe-pepper-humanoid-lineage
- softbank-robotics-nao-platform
- softbank-robotics
- spirit-ai
- sulube-jan-de-coster
- sulube
- sunday-robotics
- svaya-robotics
- switchbot
- tangible-robots-finc-profile
- tangible-robots
- tars-robotics-shanghai
- techman-robot
- technical-university-of-vienna-robotics
- tesla-optimus-program
- tesla
- tesollo
- tetheria
- tohoku-university-robotics-lab
- topstar-group
- toyota-motor-corporation-t-hr3-humanoid
- toyota-motor-corporation
- tsinghua-university-robotics-lab
- ubtech-robotics
- under-control-robotics
- unitree-robotics-h1-humanoid
- unitree-robotics
- university-of-pisa-humanoid-robotics
- university-of-tokyo-jsk-robotics-lab
- veichi-easylink-robotics
- vinmotion-duplicate-listing
- vinmotion
- westwood-robotics-duplicate-listing
- westwood-robotics
- wirobotics
- wuji-hand-product-line-entry
- wuji-tech
- x-square-robot
- xiaomi-robotics-lab-cyberone-humanoid
- xiaomi
- xpeng
- zeroth-robotics
- zhejiang-humanoid-robot-innovation-center
- zhiyuan-robotics-listing
- failure-modes
- field-context
- humanoid-safety
- intelligence-briefs
- ib-2026-001-state-of-vla-safety
- jailbreak-archaeology
- landscape
- legal
- lr-48-iatrogenic-safety-product-liability
- lr-49-detected-proceeds-liability
- lr-50-normative-drift-agent-liability
- lr-51-ineffective-defense-liability
- lr-52-reasoning-trace-legal-status
- lr-53-unreliable-metrics-compliance
- methodology
- model-vulnerability
- moltbook
- multi-agent
- podcasts
- prompt-injection
- 01-baseline-visible
- 02-html-comments
- 04-data-attributes
- 05-meta-tags
- 06-image-alt-text
- 07-aria-attributes
- 08-base64-encoded
- 09-split-fragmented
- 10-nested-context
- 11-multi-vector
- 12-social-engineering
- recovery-taxonomy
- reports
- 100-failure-first-synthesis
- 101-deployment-risk-inversion
- 102-evaluator-as-attack-surface
- 103-evaluation-monoculture-risk
- 104-pp-da-lower-asr-analysis
- 105-verification-hallucination-policy-brief
- 106-evaluator-independence-wave9-update
- 107-cross-domain-iddl-transfer-analysis
- 108-sid-threat-horizon-context-expansion
- 109-physical-digital-attack-chain
- 110-compound-attack-evidence-analysis
- 111-attack-generation-validation
- 112-iso-42001-conformity-positioning
- 113-prediction-scorecard-march-2026
- 114-sid-experiment-ethics-review
- 115-unintentional-adversary
- 116-drip-ethics-assessment
- 117-safety-improvement-paradox
- 118-defense-layer-mismatch-index
- 119-wave4-vla-sid-imb-sif-benchmark-results
- 120-infrastructure-mediated-bypass-results
- 121-sif-compliance-analysis
- 122-five-paradoxes-of-embodied-ai-safety
- 123-embodied-ai-disclosure-decision-framework
- 125-safety-instruction-effective-range
- 126-drip-recomputation-corrected-asrs
- 127-evaluation-half-life
- 128-safety-confidence-index
- 129-dlmi-wave5-update
- 130-q2-2026-threat-forecast
- 131-empirical-base-rates-for-drip
- 132-alignment-backfire-integration
- 133-compositional-supply-chain-attacks-vla
- 134-hippocratic-principle-for-ai-safety
- 135-the-therapeutic-index-of-ai-safety-interventions
- 136-iatrogenic-attack-surfaces
- 137-defense-layer-inversion-week-11-threat-brief
- 138-compositional-safety-failure-regulatory-gap
- 139-iddl-dla-counter-example-analysis
- 140-the-iatrogenesis-of-ai-safety
- 141-safety-interventions-as-attack-surfaces-the-iatrogenesis-convergence
- 142-iatrogenic-risk-horizon-threat-brief
- 143-compositional-safety-certification-eu-art9-policy-brief
- 144-the-evaluators-dilemma
- 145-defense-impossibility-theorem-for-embodied-ai
- 146-cross-embodiment-transfer-benchmark
- 147-week-12-threat-brief-modular-ai-safety-collapse
- 148-iatrogenic-exploitation-attacks
- 149-nist-ai-rmf-embodied-ai-gap-analysis
- 150-hybrid-da-sba-doubly-invisible-attacks
- 151-the-polypharmacy-hypothesis
- 152-the-evaluation-crisis-in-embodied-ai-safety
- 153-the-2027-threat-horizon
- 154-the-dscore-dual-use-disclosure-scoring-system
- 155-safety-oscillation-attacks
- 156-verbosity-signal-heterogeneity
- 157-unified-theory-of-embodied-ai-failure
- 158-embodied-ai-incident-severity-index
- 159-benchmark-divergence-analysis
- 160-anthropic-pentagon-structural-dynamics-march-2026
- 161-anthropic-openai-safety-research-analysis
- 162-safety-framework-comparative-analysis
- 163-week-13-threat-brief-convergence-crisis
- 164-safety-training-roi-analysis
- 165-four-level-iatrogenesis-model
- 166-context-collapse-first-empirical-results
- 167-the-health-of-the-ai-safety-field
- 168-detected-proceeds-reasoning-patterns
- 169-capability-safety-decoupling
- 170-detected-proceeds-corpus-analysis
- 171-corpus-pattern-mining-novel-findings
- 172-defense-effectiveness-benchmark-pilot
- 173-cross-corpus-vulnerability-comparison
- 174-defense-effectiveness-full-experiment
- 175-autonomous-attack-evolution-first-results
- 176-ethics-autonomous-red-teaming
- 177-corpus-grading-expansion-haiku
- 178-heuristic-overcount-crisis
- 179-capability-safety-transition-zone
- 180-novel-families-refusal-geometry
- 181-provider-safety-fingerprints
- 182-corpus-grading-completion-three-tier-asr-update
- 183-obliteratus-mechanistic-results
- 184-attack-evolution-lineage
- 185-compositional-reasoning-attacks
- 186-ethics-of-automated-attack-evolution
- 187-format-lock-paradox
- 188-pca-mda-attack-families
- 189-verbosity-as-jailbreak-detector
- 190-detected-proceeds-analysis
- 191-wave-12-research-synthesis
- 192-multi-agent-collusion-attacks
- 193-data-health-q1-2026
- 194-detected-proceeds-paper
- 195-reward-hacking-embodied-ai
- 196-verbosityguard-paper
- 197-eu-ai-act-compliance-assessment
- 198-polyhedral-refusal-geometry
- 199-ai-safety-lab-independence
- 200-adversarial-hall-of-fame
- 201-cross-benchmark-comparison
- 202-novel-attack-family-comparison
- 203-evidence-package-sweep-wave3
- 204-advbench-baseline-plan
- 205-attack-combination-theory
- 206-defense-impossibility-protocol
- 207-threat-horizon-2027-v2
- 208-flim-operational-assessment
- 209-regulatory-landscape-q1-2026
- 210-benchmark-execution-plan
- 211-evolved-attack-family-mapping-automated-evolution-vs-novel-families
- 212-public-dataset-coverage-analysis
- 213-silent-failures-when-ai-safety-mechanisms-produce-compliance-without-protection
- 214-automated-defense-generation-co-evolutionary-system-prompt-optimization
- 215-temporal-vulnerability-analysis-attack-era-evolution-2022-2025
- 216-training-data-for-safety-classification
- 217-competitive-intelligence-ai-safety-red-teaming-market
- 218-the-failure-first-research-programme-meta-analysis-of-ten-papers
- 219-multi-modal-attack-design-for-vision-language-action-models
- 220-lfm-thinking-12b-detected_proceeds-cross-model-validation
- 221-advbench-baseline-analysis-free-tier-model-vulnerability
- 222-the-qwen3-safety-leap-artifact-analysis
- 223-arcee-ai-trinity-safety-assessment-and-eu-compliance
- 224-iatrogenic-risks-of-rapid-safety-improvement
- 225-corpus-expansion-march-2026
- 226-the-partial-verdict-epidemic-anatomy-of-safetys-grey-zone
- 227-inter-provider-vulnerability-correlation-matrix
- 229-qwen3-benchmark-overfitting-analysis
- 230-eu-ai-act-compliance-update-reasoning-trace-governance
- 231-corpus-level-statistical-meta-analysis
- 232-minimum-safety-capability-thresholds-for-ai-model-deployment
- 233-defense-evolver-phase-0-first-live-run
- 234-attack-technique-effectiveness-ranking-llm-graded
- 235-qwen3-overfitting-analysis
- 236-flip-vs-strongreject-methodology-comparison
- 237-garak-adapter-integration-test-results
- 238-frontier-probe-ollama-cloud-large-scale-model-testing
- 239-elite-attack-suite-ollama-cloud-campaign
- 240-flip-grader-calibration-analysis
- 241-statistical-power-analysis-for-key-comparisons
- 242-the-grader-paradox-when-safety-measurement-produces-iatrogenic-harm
- 243-compliance-cascade-a-novel-attack-family
- 244-epistemic-crisis-grader-calibration-evaluation
- 245-session-attack-synthesis-sprint-13-cross-agent-results
- 246-haiku-re-grading-campaign-ollama-cloud-traces
- 247-compliance-cascade-attack-frontier-scaling-and-co-evolution
- 248-grader-confusion-matrix-and-inter-grader-agreement
- 249-evaluation-governance-the-missing-layer-in-ai-safety-regulation
- 250-the-compliance-cascade-a-dual-use-ethics-analysis
- 251-novel-attack-family-expansion-cca-v02-rse-and-grader-evasion
- 252-wave-7-validation-results
- 253-sprint-13-14-session-summary
- 254-cross-model-x-attack-family-asr-heatmap
- 255-haiku-re-grading-of-sprint-13-corpus
- 256-cca--ge-expansion-new-models-and-defense-mutations
- 257-ambiguous-calibration-results-6-grader-inter-rater-agreement
- 258-session-statistical-summary-sprint-13-15
- 259-flim-level-5-systemic-safety-theater
- 260-grader-evasion-vs-flip-vulnerability-and-authority-gradient-attack
- 261-operation-frontier-sweep-elite-attack-campaign
- 262-session-lessons-learned-sprint-13-15
- 263-kimi-k25-frontier-analysis-11tb-moe-safety-boundary
- 264-frontier-model-safety-landscape
- 266-frontier-model-safety-scorecards
- 267-format-lock-midrange-experiment-the-4-14b-data-gap-filled
- 268-coalesce-grader-validation-and-new-model-testing
- 269-systematic-audit-of-reasoning-level-detected_proceeds
- 270-corpus-expansion-ollama-cloud-trace-import
- 271-defense-co-evolution-results
- 272-ethics-of-universal-attacks-disclosure-obligations
- 273-format-lock-defense-research-five-countermeasure-architectures
- 274-cross-jurisdictional-regulatory-gap-analysis-vla-attacks-vs-coverage
- 275-evolution-run-1-mutation-analysis-and-next-gen-strategy
- 276-corpus-pattern-mining-ii-six-novel-empirical-findings
- 277-free-tier-safety-equity-differential-vulnerability-by-pricing-tier
- 278-multi-turn-vulnerability-deep-analysis
- 279-detected_proceeds-provider-signature-mechanics
- 280-safety-equity-ethics
- 281-controlled-scale-sweep-experiment-protocol
- 282-corpus-pattern-mining-five-novel-empirical-findings
- 283-cross-provider-safety-inheritance
- 284-defense-evolver-phase-0-automated-system-prompt-evolution
- 285-safety-polypharmacy-empirical-evidence
- 286-temporal-drift-attack-family-design
- 287-detected_proceeds-reasoning-anatomy
- 288-iatrogenic-safety-paradox-ethics
- 289-threat-horizon-q2-2026
- 290-wave-1-sprint-15-cross-agent-synthesis
- 291-wave-1-2-ccs-readiness-audit
- 292-aies-paper-scoping-and-cca-disclosure-framework
- 293-format-lock-mid-range-experiment-4-14b-elevated-asr
- 294-detected_proceeds-reasoning-audit-195-safety-aware-traces-proceed
- 295-independence-scorecard-sprint-15-update
- 296-sprint-15-round-2-synthesis-dp-validation-and-gemma-4b
- 297-emotional-manipulation-attack-family-deep-dive
- 298-defense-landscape-analysis-what-works-and-what-doesnt
- 299-novel-attack-family-baseline-traces
- 300-vla-data-curation-sprint15
- 301-detected-proceeds-definitive-synthesis
- 302-capability-floor-model-update
- 303-cross-embodiment-vulnerability-policy-brief
- 304-sprint15-comprehensive-benchmark
- 305-ethics-emotional-manipulation
- 306-power-dynamics-sprint15
- 307-vla-adversarial-landscape
- 308-actionable-defense-recommendations
- 309-next-phase-attack-priorities
- 310-corpus-state-212-models
- 311-autoresearch-autonomous-agent-analysis
- 312-g0dm0d3-framework-analysis
- 313-technique-level-asr-analysis
- 314-iatrogenic-safety-empirical-pilot
- 315-l1b3rt4s-cross-scale-effectiveness
- 316-sampling-parameter-manipulation
- 317-l1b3rt4s-corpus-cross-model
- 318-defense-privilege-hierarchy
- 319-sprint16-findings-synthesis
- 320-l1b3rt4s-8model-synthesis
- 321-defense-positional-bias
- 322-g0dm0d3-assimilation-dual-use-ethics
- 323-cross-attack-family-synthesis
- 324-libertas-vla-detected-proceeds
- 325-paired-format-lock-libertas-orthogonality
- 326-detected-proceeds-ethical-implications
- 327-independence-scorecard-march
- 328-defense-data-consolidation
- 329-vla-coverage-gap-assessment
- 330-grading-infrastructure-audit
- 331-format-lock-reasoning-models
- 332-visual-jailbreak-meta-analysis
- 333-task-framing-effect
- 334-visual-jailbreak-ethics-review
- 335-l3-l8-evolved-attacks
- 336-detected-proceeds-evolved-cca
- 337-specification-hijacking-compound-attack
- 338-task-framing-jailbreak-vector
- 339-visual-jailbreaks-evolved-stage2-analysis
- 349-gemma-family-safety-scaling
- 350-mythos-system-card-analysis
- 352-meta-jailbreak-notebooklm
- 47-embodied-cap-floor-action-space-hijack
- 49-vla-cross-embodiment-vulnerability-analysis
- 59-the-compliance-paradox
- 61-the-evaluation-paradox
- 63-unified-vulnerability-thesis
- 66-verification-hallucination-in-multi-agent-systems
- 67-unified-thesis-layer-0-extension
- 68-evaluator-calibration-disclosure-standard
- 73-recursive-evaluator-ethics
- 75-blindfold-action-level-threat-analysis
- 76-evaluator-governance-framework
- 78-defense-impossibility-triangle
- 79-accountability-vacuum-action-layer
- 85-evaluation-ceiling-embodied-attacks
- 87-ungovernable-attack-evaluation-invisible
- 88-inverse-detectability-danger-law
- 89-dual-use-obligations-embodied-ai
- 92-worker-safety-impact-vla-attack-families
- 93-iddl-srda-ethics-addendum
- 96-embodied-ai-governance-proposal
- 97-competence-danger-coupling
- 98-context-half-life-predictive-model
- 99-cdc-governance-trilemma
- report-21-regulatory-compliance-and-risk-mitigation-for-embodied-multi-agent
- report-22-comprehensive-sector-specific-nist-ai-risk-management-framework-ai
- report-23-technical-gap-analysis-of-iso-and-iec-standards
- report-24-cognitive-capture-and-behavioral-phase-transitions-policy-and
- report-25-the-paradox-of-capability-a-comprehensive-analysis-of
- report-26-computational-reliability-and-the-propagation-of-measurement-uncertainty
- report-27-the-federated-aegis-a-unified-assurance-framework-for
- report-28-the-architecture-of-kinetic-risk-insurance-underwriting-as
- report-29-strategic-framework-for-sovereign-ai-assurance-establishing-an
- report-30-multi-agent-system-safety-standard-masss-a-comprehensive-framework
- report-31-the-policy-implications-of-historical-jailbreak-technique-evolution
- report-32-certified-embodied-intelligence-a-comprehensive-framework-for-vision-language-action
- report-33-capability-does-not-imply-safety-empirical-evidence-from
- report-34-cross-model-vulnerability-inheritance-in-multi-agent-systems
- report-35-emergent-algorithmic-hierarchies-a-socio-technical-analysis-of-the
- report-36-the-semantic-supply-chain-vulnerabilities-viral-propagation-and
- report-37-the-erosive-narrative-philosophical-framing-multi-agent-dynamics-and
- report-38-the-autonomous-threat-vector-a-comprehensive-analysis-of
- report-39-systemic-failure-modes-in-embodied-multi-agent-ai-an
- report-40-cross-modal-vulnerability-inheritance
- report-41-universal-vulnerability-of-small-language-models-to-supply-chain-attacks
- report-42-cross-embodiment-adversarial-transfer-in-vla-models
- report-43-deceptive-alignment-detection-under-evaluation-aware-conditions
- report-44-instruction-hierarchy-subversion-in-long-horizon-agentic-execution
- report-45-inference-trace-manipulation-as-an-adversarial-attack-surface
- report-46-quantifying-the-governance-lag-structural-causes-and-temporal-dynamics
- synthesis
- videos
- results
- search
- services
- advisory
- intelligence-briefs
- red-team-assessments
- safety-audits
- site/src/content/daily-paper
Some content is hidden
Large Commits have some content hidden by default. Use the searchbox below for content that may be hidden.
Large diffs are not rendered by default.
Large diffs are not rendered by default.
Large diffs are not rendered by default.
Large diffs are not rendered by default.
Large diffs are not rendered by default.
Large diffs are not rendered by default.
| Original file line number | Diff line number | Diff line change | |
|---|---|---|---|
| |||
1 | | - | |
| 1 | + | |
Large diffs are not rendered by default.
Large diffs are not rendered by default.
Large diffs are not rendered by default.
0 commit comments