---
title: "Seguridad ng AI agent: OWASP Top 10, mga insidente, depensa · DotsAgent"
description: "Gabay sa seguridad ng agent: dalawang OWASP Top 10 list para sa 2026, 17 totoong insidente mula MCP hanggang OpenClaw, 15 depensa, at checklist para sa mga team na naglalabas ng AI agent."
url: https://dotsagent.io/fil/security
---

Seguridad · gabay

# Seguridad ng agent

Nagbabasa ang mga agent ng text na isinulat ng ibang tao, at pagkatapos ay kumikilos gamit ang mga credential mo. Inilalahad sa page na ito ang pangunahing tuntunin, ang dalawang OWASP list para sa 2026, ang mga insidente sa ngayon, at ang mga depensang makapipigil sana sa mga ito.

## Ang nakamamatay na tatluhan

1. **Access sa pribadong data** Email, repository, database, file, o anumang nasa likod ng mga credential mo.
2. **Pagkakalantad sa hindi pinagkakatiwalaang content** Mga web page, issue, support ticket, papasok na email at paglalarawan ng tool: anumang text na kayang isulat ng attacker.
3. **Kakayahang makipag-ugnayan sa labas** Pagpapadala ng email, pagbubukas ng pull request, pagkuha ng URL, o pagpapakita ng mga remote image. Pinangalanan ni Simon Willison ang kombinasyong ito ng tatlong bahagi noong Hunyo 2025.

Kung taglay ng iisang agent ang tatlong ito, ipagpalagay na puwedeng gamitin ng prompt injection para ipasa nito ang data mo sa attacker. Huwag umasa na tatanggi ang model; alisin ang kahit isang bahagi sa bawat agent at session.

- [Checklist sa seguridad](https://dotsagent.io/fil/security/checklist): 22 pagsusuri sa mga input, tool, runtime, MCP, CI at operasyon. Lagyan ng tsek habang nagpapatuloy ka, at i-export ang resulta bilang Markdown file.

- [Talaan ng mga insidente](https://dotsagent.io/fil/security/incidents): Para sa bawat pampublikong insidente sa seguridad ng agent mula Abril 2025: ano ang nangyari, bakit nagtagumpay ang pag-atake, at ano ang dapat baguhin sa sarili mong setup.

## Mga kamakailang insidente

- Hun 5, 2026 [Pag-hijack ng session sa MCP Python SDK at pag-access sa mga task ng ibang session](https://dotsagent.io/fil/security/incidents/2026-06-mcp-python-sdk-session-hijack)
- Hun 2026 [Dahil sa auto-approval ng Claude Code WebFetch, nailabas ang data sa pamamagitan ng huggingface.co](https://dotsagent.io/fil/security/incidents/2026-06-claude-code-webfetch-exfiltration)
- Abr 15, 2026 [Comment and Control: Ninanakaw ng text ng PR ang mga lihim mula sa mga CI agent](https://dotsagent.io/fil/security/incidents/2026-04-comment-and-control-ci-secrets)
- Peb 4, 2026 [Naglantad ang MCP TypeScript SDK ng mga response sa pagitan ng mga client](https://dotsagent.io/fil/security/incidents/2026-02-mcp-typescript-sdk-response-leak)
- Peb 1, 2026 [ClawHavoc: daan-daang mapaminsalang ClawHub skill ang nagpakalat ng AMOS](https://dotsagent.io/fil/security/incidents/2026-02-clawhavoc-malicious-skills)

## OWASP Top 10 para sa Agentic Applications 2026

Inilathala ng OWASP GenAI Security Project ang listahang ito noong Disyembre 9, 2025. Saklaw nito ang mga panganib na lumilitaw kapag nagpaplano ang isang model, nagpapanatili ng memory, tumatawag ng mga tool at nakikipagtulungan sa iba pang agent.

1. `ASI01` **Pag-hijack sa layunin ng agent** Binabago ng attacker ang layuning tinutupad ng agent, karaniwan sa pamamagitan ng mga tagubiling nakatago sa content na binabasa nito. Pagkatapos, ginagamit ng agent ang mga tool at pahintulot ng user para isulong ang layunin ng attacker.
2. `ASI02` **Maling paggamit at pagsasamantala sa tool** Gumagamit ang agent ng mga lehitimong tool sa mapaminsalang paraan, gaya ng pagbura ng mga record, pagpapadala ng mga mensahe o sunod-sunod na pagtawag sa mga tool, dahil minanipula ito o mas malawak ang saklaw ng mga tool nito kaysa sa kailangan ng task.
3. `ASI03` **Pang-aabuso sa identidad at pribilehiyo** Kumikilos ang mga agent gamit ang mga credential, ipinasa sa kanila na token at minanang pahintulot. Sinasamantala ng mga attacker ang mga identidad na ito o ang mga puwang sa pagitan ng mga ito para magtaas ng pribilehiyo o magpanggap na ibang tao.
4. `ASI04` **Mga kahinaan sa supply chain ng agent** Maaaring mapaminsala o makompromiso ang mga tool, MCP server, skill, plugin, model at prompt na nilo-load habang binubuo o pinapatakbo ang system. Dahil maraming bahagi ang dynamic na nilo-load ng mga agent, maaapektuhan ng isang mapaminsalang bahagi ang bawat session na gumagamit nito.
5. `ASI05` **Hindi inaasahang pagpapatakbo ng code (RCE)** Maaaring malinlang ang mga agent na sumusulat at nagpapatakbo ng code, o nagpapasa ng output ng model sa mga shell at interpreter, para magpatakbo sa host ng mga command na pinili ng attacker.
6. `ASI06` **Paglalason sa memory at context** Naglalagay ang mga attacker ng maling impormasyon o tagubilin sa memory ng agent, mga kinuhang dokumento o naka-save na context. Nananatili ang lason at nakaaapekto sa mga susunod na session kahit matagal nang wala ang orihinal na input.
7. `ASI07` **Hindi ligtas na komunikasyon sa pagitan ng mga agent** Ipinapadala ang mga mensahe sa pagitan ng mga agent nang walang wastong authentication, pagsusuri sa integridad o validation. Dahil dito, maaari itong pekein, ulitin o baguhin para iligaw ang agent na tatanggap nito.
8. `ASI08` **Mga sunod-sunod na pagkabigo** Ang isang pagkakamali—gaya ng nalason na input, maling resulta ng tool o nakompromisong agent—ay mabilis na kumakalat sa magkakaugnay na agent at automated na hakbang, nang mas mabilis kaysa matukoy ito ng mga tao.
9. `ASI09` **Pagsasamantala sa Tiwala sa Agent** Kumpiyansa at matulungin ang dating ng mga agent, kaya madalas aprubahan ng mga tao ang mga mungkahi ng mga ito. Sinasamantala ng mga attacker ang tiwalang iyon para papag-ayunin ang isang tao sa mapaminsalang aksyon o magbunyag ng impormasyon.
10. `ASI10` **Mga Rogue Agent** Patuloy na kumikilos nang kusa ang isang nakompromiso o lumihis sa nilalayong asal na agent, lampas sa saklaw at pangangasiwang itinakda rito.

## OWASP Top 10 para sa LLM Applications 2026

Inilathala ang edisyong ito noong Agosto 4, 2026 at pumapalit ito sa listahan para sa 2025. Umakyat ang Excessive Agency mula ikaanim tungo sa ikatlong puwesto, at pinalitan ng Hidden Context Exposure ang pangalang System Prompt Leakage.

1. `LLM01` **Prompt Injection** Binabago ng input ang asal ng model sa mga paraang hindi nilayon ng developer. Maaaring direkta itong manggaling sa user o hindi direkta mula sa mga dokumento, web page at resulta ng tool na binabasa ng model.
2. `LLM02` **Pagbubunyag ng Sensitibong Impormasyon** Nagbubunyag ang model o application sa output nito ng personal na data, mga credential, lihim ng negosyo o iba pang kumpidensyal na materyal na nagmula sa training data, context o mga konektadong system.
3. `LLM03` **Sobrang Lawak na Kakayahang Kumilos** Binibigyan ng application ang model ng mas maraming function, pahintulot o awtonomiya kaysa kailangan ng gawain, kaya maaaring magdulot ng totoong pinsala ang minanipula o maling output. Umakyat ito mula sa ikaanim na puwesto noong 2025 tungo sa ikatlo noong 2026.
4. `LLM04` **Supply Chain** Maaaring pakialaman o magkaroon ng kahinaan ang mga third-party na model, dataset, adapter, package at plugin, at naipapasa ng mga ito ang panganib na iyon sa iyong application.
5. `LLM05` **Pagkalason sa Data at Model** Minamanipula ng mga attacker ang data para sa pre-training, fine-tuning o embedding upang magpasok ng mga backdoor, bias o maling asal na lalabas lang kalaunan sa production.
6. `LLM06` **Walang Limitasyong Paggamit** Kung walang limitasyon sa mga request, laki ng input o compute, maaaring palakihin ng mga attacker ang bill mo, ubusin ang mga resource o kopyahin ang isang model sa pamamagitan ng napakaraming query.
7. `LLM07` **Maling Impormasyon** Gumagawa ang model ng mali o mapanlinlang na output na mukhang kapani-paniwala, at kumikilos ang mga user o downstream system batay rito nang hindi muna nagsusuri.
8. `LLM08` **Pagkakalantad ng Nakatagong Context** Dating tinatawag na System Prompt Leakage. Maaaring makuha ang mga system prompt, nakatagong instruction at iba pang context na hindi dapat makita ng user, kaya nalalantad ang mga panuntunan, lohika o lihim na inilagay roon.
9. `LLM09` **Mga Kahinaan sa Vector at Embedding** Dahil sa mga depekto sa paggawa, pag-iimbak at pagkuha ng mga embedding, maaaring magpasok ng content ang mga attacker, maglabas ng data sa pagitan ng mga tenant o makuha muli ang source text. Pinakamalaki ang epekto nito sa mga RAG system.
10. `LLM10` **Hindi Ligtas na Pangangasiwa sa Output** Umaabot ang output ng model sa mga browser, shell, database o iba pang component nang walang validation o encoding, kaya nagiging posible ang XSS, SQL injection, code execution at data exfiltration.

## Mga depensa

Labinlimang dokumentadong depensa, na bawat isa ay may link sa pinagmulan nito. Gumamit ng ilang patong ng depensa dahil walang iisang depensang kayang pumigil sa lahat ng pag-atake.

### Putulin ang nakamamatay na tatluhang ito

Panuntunan ni Simon Willison: maaaring gamitin laban sa iyo ang anumang tekstong binabasa ng isang agent kung kaya nitong magbasa ng pribadong data, nakakakita ito ng hindi pinagkakatiwalaang content at nakakapagpadala ito ng data palabas. Alisin ang kahit isa sa tatlong ito sa bawat agent o session. Halimbawa, huwag bigyan ng mga sikreto ang agent na nagsusuri ng mga pampublikong issue, at huwag bigyan ng outbound channel ang agent na may hawak ng mga sikreto.

[simonwillison.net](https://simonwillison.net/2025/jun/16/the-lethal-trifecta/)

### Limitahan ang agent pagkatapos ng hindi pinagkakatiwalaang input

Iisa ang tuntunin sa pananaliksik tungkol sa mga design pattern para sa seguridad ng agent: kapag nakatanggap na ang agent ng hindi pinagkakatiwalaang input, hindi ito dapat makapagpasimula ng mga aksyong may malaking epekto. Kabilang sa mga pattern ang action-selector, plan-then-execute, dual LLM at context minimisation. Pumili ng isa para sa bawat workflow; halimbawa, pagtibayin muna ang plano bago magbasa ang agent ng anumang hindi pinagkakatiwalaang data.

[arxiv.org](https://arxiv.org/abs/2506.08837)

### Subaybayan ang daloy ng data gamit ang CaMeL

Hinahati ng CaMeL sa dalawa ang agent: nagsusulat ng code ang isang privileged planner batay sa kahilingan ng user, habang humahawak naman ng hindi pinagkakatiwalaang data ang isang quarantined model. May capability tag ang mga value mula sa quarantined na bahagi, at sinusuri ng mga policy ang mga tag na iyon bago patakbuhin ang anumang tool. Sa paper, nalutas nito ang 77% ng mga AgentDojo task nang may mapapatunayang seguridad, kumpara sa 84% para sa agent na walang proteksiyon.

[arxiv.org](https://arxiv.org/abs/2503.18813)

### Gumamit ng mga credential na may pinakamababang pribilehiyo

Bilang default, bigyan ang mga agent ng read-only na access na limitado sa proyekto at huwag silang bigyan ng admin o service_role key, na nagbi-bypass sa row-level security sa Supabase. Limitahan ang mga CI at repository token sa iisang trabahong kailangan ng mga ito. Natunton sa isang GitHub token na may sobrang lawak na access sa CodeBuild ang insidente sa Amazon Q Developer.

[supabase.com](https://supabase.com/blog/defense-in-depth-mcp)[aws.amazon.com](https://aws.amazon.com/security/security-bulletins/AWS-2025-015/)

### Humingi ng pag-apruba para sa mga aksyong may malaking epekto

Atasan ang isang tao na kumpirmahin ang mga tool call na sumusulat, nagtatanggal, nagpapadala o gumagastos, at tanggihan ang mga ito bilang default kapag walang sumagot. Inirerekomenda ng Supabase ang manu-manong pag-apruba sa mga MCP tool call. Sa OpenClaw, itakda ang tools.exec.ask sa always at panatilihing deny ang askFallback. Ipakita ang lahat ng argumento para makita ng tagasuri kung ano talaga ang tatakbuhin.

[supabase.com](https://supabase.com/blog/defense-in-depth-mcp)[docs.openclaw.ai](https://docs.openclaw.ai/tools/exec-approvals)

### I-sandbox ang code at pagpapatakbo ng tool

Patakbuhin ang mga shell command at nabuong code sa container o VM na walang hawak na credential at workspace lang ang naa-access. Naka-off bilang default ang sandboxing ng OpenClaw, at nakatakda sa full ang tools.exec.security sa mga gateway host. Kaya i-on ang sandboxing, itakda ang exec security sa deny o allowlist, itakda sa true ang fs.workspaceOnly at panatilihing naka-disable ang elevated mode. Kumpirmahin ang resulta gamit ang openclaw sandbox explain.

[docs.openclaw.ai](https://docs.openclaw.ai/gateway/sandboxing)[docs.openclaw.ai](https://docs.openclaw.ai/gateway/security/hardened-baseline)

### Limitahan ang papalabas na access sa network

Bilang default, harangin ang papalabas na trapiko mula sa mga agent at MCP server, at saka payagan lang ang mga host na kailangan ng bawat isa. Huwag awtomatikong aprubahan ang mga fetch sa mga multi-tenant host kung saan puwedeng mag-publish ang sinuman. Ganito naging channel ng exfiltration ang huggingface.co sa CVE-2026-54316. Dapat makakonekta lang ang email server sa mail API nito at wala nang iba, gaya ng ipinakita ng postmark-mcp.

[nvd.nist.gov](https://nvd.nist.gov/vuln/detail/CVE-2026-54316)[koi.ai](https://www.koi.ai/blog/postmark-mcp-npm-malicious-backdoor-email-theft)

### Huwag ilantad sa internet ang mga control plane

I-bind sa loopback ang mga agent gateway, dashboard at debug proxy, at mangailangan ng token na hindi bababa sa 24 na character, halimbawa, mula sa openssl rand -hex 32. Gumamit ng SSH tunnel o Tailscale Serve para ma-access ang mga ito nang malayuan, at gamitin lang ang Tailscale Funnel kapag may password auth. Regular na patakbuhin ang openclaw security audit --deep.

[docs.openclaw.ai](https://docs.openclaw.ai/gateway/security/network-exposure)[docs.openclaw.ai](https://docs.openclaw.ai/gateway/tailscale)[docs.openclaw.ai](https://docs.openclaw.ai/gateway/security/running-the-audit)

### I-validate ang audience ng MCP token

Inaatasan ng MCP authorisation spec ang server na tanggihan ang mga access token na hindi para rito inilabas, at ipinagbabawal nitong ipasa ang token ng client sa upstream API. Nagpapadala ang mga client ng RFC 8707 resource indicator para maitali ang bawat token sa iisang server. Kailangang kumuha ng pahintulot ang proxy server mula sa bawat client; kung hindi, magiging confused deputy ito.

[modelcontextprotocol.io](https://modelcontextprotocol.io/specification/2026-07-28/basic/authorization/security-considerations)[modelcontextprotocol.io](https://modelcontextprotocol.io/docs/tutorials/security/security_best_practices)

### Ihiwalay ang mga MCP session at tenant

Gumawa ng hiwalay na server at transport instance para sa bawat session sa halip na magbahagi ng iisang instance sa lahat ng client. Itali ang bawat session at task sa authenticated principal na gumawa nito, at tiyakin ang pagkakatali sa bawat request. Nagmula ang dalawang MCP SDK advisory noong 2026 sa shared o hindi nakataling state.

[github.com](https://github.com/advisories/GHSA-345p-7cg4-v4c7)[github.com](https://github.com/advisories/GHSA-JPW9-PFVF-9F58)

### Siyasatin ang mga skill, plugin at MCP server

I-pin ang eksaktong mga bersyon, basahin ang diff bago ang bawat update, at tingnan ang mga resulta ng scanner gaya ng VirusTotal at ang status ng security audit sa ClawHub. I-hash ang mga paglalarawan ng tool kapag nag-apruba ka ng server, at magbabala kapag nagbago ang mga ito para matukoy ang mga rug pull. Walang built-in na pagharang ang OpenClaw sa oras ng pag-install, kaya ikaw mismo ang magtakda ng security.installPolicy.

[openclaw.ai](https://openclaw.ai/blog/virustotal-partnership)[docs.openclaw.ai](https://docs.openclaw.ai/clawhub/security-audits)[invariantlabs.ai](https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks)[docs.openclaw.ai](https://docs.openclaw.ai/help/faq/security-and-access-control)

### Kontrolin kung sino ang puwedeng mag-message sa agent

Limitahan ang DM access sa pairing o allowlist, at hingin na banggitin ang agent bago ito kumilos sa mga group chat. Itakda ang session.dmScope sa per-channel-peer para hindi magbahagi ng context ang mga sender. Sinumang makakapag-message sa agent ay maaaring sumubok na magbigay rito ng mga tagubilin, kaya bahagi ng attack surface mo ang listahan ng mga sender.

[docs.openclaw.ai](https://docs.openclaw.ai/gateway/security/access-control)[docs.openclaw.ai](https://docs.openclaw.ai/gateway/security/hardened-baseline)

### Ilayo ang mga secret sa hindi pinagkakatiwalaang CI run

Huwag magpatakbo ng agent na may repository secret sa mga workflow na puwedeng pasimulan ng mga tagalabas sa pamamagitan ng pull request, issue o comment. Ituring na mapaminsala ang mga title, description at comment mula sa mga event na iyon. Kung talagang kailangan ng isang hakbang ang mga secret, patakbuhin lang ito kapag naaprubahan na ng maintainer ang run.

[oddguan.com](https://oddguan.com/blog/comment-and-control-prompt-injection-credential-theft-claude-code-gemini-cli-github-copilot/)

### Ituring na hindi pinagkakatiwalaan ang output ng model

I-encode o i-sanitise ang output ng model bago ito i-render, at huwag itong ipasa nang walang pagsusuri sa shell, SQL query o browser. Harangin ang awtomatikong pag-load ng mga markdown image at link papunta sa mga external domain, at magtakda ng mahigpit na Content Security Policy. Nailabas ng EchoLeak ang data sa pamamagitan ng mga URL na kusang naglo-load.

[genai.owasp.org](https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/)[nvd.nist.gov](https://nvd.nist.gov/vuln/detail/cve-2025-32711)

### I-verify ang mga pirma ng agent bago magbigay ng pahintulot

Para matukoy ang agent na tumatawag sa site o API mo, i-verify ang Web Bot Auth signature nito gamit ang mga key na inilalathala ng operator sa /.well-known/http-message-signatures-directory. Lumalagda ang ChatGPT agent bilang Signature-Agent https://chatgpt.com. Ipinapakita ng valid na signature kung sino ang nagpapatakbo sa agent, hindi kung sinong user ang nagpadala ng request o kung ano ang pinapayagang gawin ng user na iyon. Kaya hiwalay na magbigay ng pahintulot sa bawat request.

[datatracker.ietf.org](https://datatracker.ietf.org/doc/draft-ietf-webbotauth-httpsig-protocol/)[help.openai.com](https://help.openai.com/en/articles/11845367-chatgpt-agent-allowlisting)

## Mga tanong tungkol sa seguridad ng agent

### Ano ang prompt injection sa mga AI agent?

Ang prompt injection ay text na itinuturing ng model na mga tagubilin kahit datos lang ito, halimbawa, mula sa web page, email o paglalarawan ng tool. Sa isang agent, maaari itong magpasimula ng mga tool call na gumagamit ng mga credential mo. Itinala ito ng OWASP bilang LLM01:2026, at saklaw ng Agent Goal Hijack (ASI01) ang anyo nito sa mga agent.

### Ano ang lethal trifecta para sa mga AI agent?

Pangalan ito ni Simon Willison para sa isang agent na may access sa pribadong data, nakakakita ng hindi pinagkakatiwalaang content at may paraan para makipag-ugnayan sa labas. Kapag naroon ang tatlo, maaaring basahin ng prompt injection ang data mo at ipadala ito sa labas. Isang klasikong halimbawa nito ang pagtagas ng MCP token ng Supabase noong 2025.

### Paano ko poprotektahan ang isang MCP server?

Tanggihan ang mga access token na hindi inilabas para sa server mo, at huwag kailanman ipasa ang token ng client sa upstream API. Gumawa ng hiwalay na server at transport instance para sa bawat session, at iugnay ang mga session at task sa authenticated na user. Gamitin ang TypeScript SDK na bersyong 1.26.0 o mas bago at ang Python SDK na bersyong 1.27.2 o mas bago para maiwasan ang pagtagas ng response sa pagitan ng mga client at ang pag-hijack ng session.

### Mapipigilan ba ng mas mahusay na system prompt ang prompt injection?

Huwag umasa rito. Ayon sa pananaliksik sa mga design pattern para sa mga agent, kapag nakapasok na sa agent ang hindi pinagkakatiwalaang input, dapat itong higpitan para hindi makapagpasimula ang input ng mga aksiyong may malaking epekto. Nalutas ng CaMeL, na nagpapatupad nito sa pamamagitan ng pagsubaybay sa mga capability, ang 77% ng mga task sa AgentDojo nang may napapatunayang seguridad; nakakuha naman ng 84% ang agent na walang depensa.

### Ano ang pagkakaiba ng OWASP LLM Top 10 at Agentic Top 10?

Saklaw ng OWASP Top 10 for LLM Applications, na inilabas ang 2026 edition noong 4 August 2026, ang mga panganib sa anumang application na binuo gamit ang language model. Saklaw naman ng OWASP Top 10 for Agentic Applications, na inilabas noong 9 December 2025, ang mga pagbabagong dulot ng kakayahan ng model na magplano, gumamit ng mga tool, magpanatili ng memory at makipag-ugnayan sa ibang agent. Karaniwang kailangan ng mga gumagawa ng agent ang dalawa.

### Ligtas bang ilantad sa internet ang OpenClaw gateway?

Hindi. Panatilihin ang default na loopback ng gateway.bind, at gumamit ng SSH tunnel o Tailscale Serve kung kailangan mo ng remote access. Nakatala ang 192,492 nakalantad na gateway sa OpenA2A noong 1 September 2026, at ipinakita ng CVE-2026-25253 na kailangang agad mag-install ng patch kahit ang mga installation na loopback lang ang gamit.

## Mga source

1. [genai.owasp.org](https://genai.owasp.org/resource/owasp-top-10-for-agentic-applications-for-2026/)/resource/owasp-top-10-for-agentic-applications-for-2026/
2. [genai.owasp.org](https://genai.owasp.org/download/52117)/download/52117
3. [genai.owasp.org](https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/)/resource/owasp-genai-llm-top-10-2026/
4. [github.com](https://github.com/GenAI-Security-Project/GenAI-LLM-Top10)/GenAI-Security-Project/GenAI-LLM-Top10

Independent na sanggunian para sa mga gumagawa ng AI agent. Hindi kami kaanib ng alinman sa mga vendor na nakalista rito.

© 2026 DotsAgent · Sinuri ang mga detalye noong Oktubre 1, 2026
