dotsagent.io
Wika:Filipino
Seguridad · gabay

Seguridad ng agent

Nagbabasa ang mga agent ng text na isinulat ng ibang tao, at pagkatapos ay kumikilos gamit ang mga credential mo. Inilalahad sa page na ito ang pangunahing tuntunin, ang dalawang OWASP list para sa 2026, ang mga insidente sa ngayon, at ang mga depensang makapipigil sana sa mga ito.

Ang nakamamatay na tatluhan

  1. Access sa pribadong dataEmail, repository, database, file, o anumang nasa likod ng mga credential mo.
  2. Pagkakalantad sa hindi pinagkakatiwalaang contentMga web page, issue, support ticket, papasok na email at paglalarawan ng tool: anumang text na kayang isulat ng attacker.
  3. Kakayahang makipag-ugnayan sa labasPagpapadala ng email, pagbubukas ng pull request, pagkuha ng URL, o pagpapakita ng mga remote image. Pinangalanan ni Simon Willison ang kombinasyong ito ng tatlong bahagi noong Hunyo 2025.

Kung taglay ng iisang agent ang tatlong ito, ipagpalagay na puwedeng gamitin ng prompt injection para ipasa nito ang data mo sa attacker. Huwag umasa na tatanggi ang model; alisin ang kahit isang bahagi sa bawat agent at session.

Mga kamakailang insidente

OWASP Top 10 para sa Agentic Applications 2026

Inilathala ng OWASP GenAI Security Project ang listahang ito noong Disyembre 9, 2025. Saklaw nito ang mga panganib na lumilitaw kapag nagpaplano ang isang model, nagpapanatili ng memory, tumatawag ng mga tool at nakikipagtulungan sa iba pang agent.

  1. ASI01
    Pag-hijack sa layunin ng agent

    Binabago ng attacker ang layuning tinutupad ng agent, karaniwan sa pamamagitan ng mga tagubiling nakatago sa content na binabasa nito. Pagkatapos, ginagamit ng agent ang mga tool at pahintulot ng user para isulong ang layunin ng attacker.

  2. ASI02
    Maling paggamit at pagsasamantala sa tool

    Gumagamit ang agent ng mga lehitimong tool sa mapaminsalang paraan, gaya ng pagbura ng mga record, pagpapadala ng mga mensahe o sunod-sunod na pagtawag sa mga tool, dahil minanipula ito o mas malawak ang saklaw ng mga tool nito kaysa sa kailangan ng task.

  3. ASI03
    Pang-aabuso sa identidad at pribilehiyo

    Kumikilos ang mga agent gamit ang mga credential, ipinasa sa kanila na token at minanang pahintulot. Sinasamantala ng mga attacker ang mga identidad na ito o ang mga puwang sa pagitan ng mga ito para magtaas ng pribilehiyo o magpanggap na ibang tao.

  4. ASI04
    Mga kahinaan sa supply chain ng agent

    Maaaring mapaminsala o makompromiso ang mga tool, MCP server, skill, plugin, model at prompt na nilo-load habang binubuo o pinapatakbo ang system. Dahil maraming bahagi ang dynamic na nilo-load ng mga agent, maaapektuhan ng isang mapaminsalang bahagi ang bawat session na gumagamit nito.

  5. ASI05
    Hindi inaasahang pagpapatakbo ng code (RCE)

    Maaaring malinlang ang mga agent na sumusulat at nagpapatakbo ng code, o nagpapasa ng output ng model sa mga shell at interpreter, para magpatakbo sa host ng mga command na pinili ng attacker.

  6. ASI06
    Paglalason sa memory at context

    Naglalagay ang mga attacker ng maling impormasyon o tagubilin sa memory ng agent, mga kinuhang dokumento o naka-save na context. Nananatili ang lason at nakaaapekto sa mga susunod na session kahit matagal nang wala ang orihinal na input.

  7. ASI07
    Hindi ligtas na komunikasyon sa pagitan ng mga agent

    Ipinapadala ang mga mensahe sa pagitan ng mga agent nang walang wastong authentication, pagsusuri sa integridad o validation. Dahil dito, maaari itong pekein, ulitin o baguhin para iligaw ang agent na tatanggap nito.

  8. ASI08
    Mga sunod-sunod na pagkabigo

    Ang isang pagkakamali—gaya ng nalason na input, maling resulta ng tool o nakompromisong agent—ay mabilis na kumakalat sa magkakaugnay na agent at automated na hakbang, nang mas mabilis kaysa matukoy ito ng mga tao.

  9. ASI09
    Pagsasamantala sa Tiwala sa Agent

    Kumpiyansa at matulungin ang dating ng mga agent, kaya madalas aprubahan ng mga tao ang mga mungkahi ng mga ito. Sinasamantala ng mga attacker ang tiwalang iyon para papag-ayunin ang isang tao sa mapaminsalang aksyon o magbunyag ng impormasyon.

  10. ASI10
    Mga Rogue Agent

    Patuloy na kumikilos nang kusa ang isang nakompromiso o lumihis sa nilalayong asal na agent, lampas sa saklaw at pangangasiwang itinakda rito.

OWASP Top 10 para sa LLM Applications 2026

Inilathala ang edisyong ito noong Agosto 4, 2026 at pumapalit ito sa listahan para sa 2025. Umakyat ang Excessive Agency mula ikaanim tungo sa ikatlong puwesto, at pinalitan ng Hidden Context Exposure ang pangalang System Prompt Leakage.

  1. LLM01
    Prompt Injection

    Binabago ng input ang asal ng model sa mga paraang hindi nilayon ng developer. Maaaring direkta itong manggaling sa user o hindi direkta mula sa mga dokumento, web page at resulta ng tool na binabasa ng model.

  2. LLM02
    Pagbubunyag ng Sensitibong Impormasyon

    Nagbubunyag ang model o application sa output nito ng personal na data, mga credential, lihim ng negosyo o iba pang kumpidensyal na materyal na nagmula sa training data, context o mga konektadong system.

  3. LLM03
    Sobrang Lawak na Kakayahang Kumilos

    Binibigyan ng application ang model ng mas maraming function, pahintulot o awtonomiya kaysa kailangan ng gawain, kaya maaaring magdulot ng totoong pinsala ang minanipula o maling output. Umakyat ito mula sa ikaanim na puwesto noong 2025 tungo sa ikatlo noong 2026.

  4. LLM04
    Supply Chain

    Maaaring pakialaman o magkaroon ng kahinaan ang mga third-party na model, dataset, adapter, package at plugin, at naipapasa ng mga ito ang panganib na iyon sa iyong application.

  5. LLM05
    Pagkalason sa Data at Model

    Minamanipula ng mga attacker ang data para sa pre-training, fine-tuning o embedding upang magpasok ng mga backdoor, bias o maling asal na lalabas lang kalaunan sa production.

  6. LLM06
    Walang Limitasyong Paggamit

    Kung walang limitasyon sa mga request, laki ng input o compute, maaaring palakihin ng mga attacker ang bill mo, ubusin ang mga resource o kopyahin ang isang model sa pamamagitan ng napakaraming query.

  7. LLM07
    Maling Impormasyon

    Gumagawa ang model ng mali o mapanlinlang na output na mukhang kapani-paniwala, at kumikilos ang mga user o downstream system batay rito nang hindi muna nagsusuri.

  8. LLM08
    Pagkakalantad ng Nakatagong Context

    Dating tinatawag na System Prompt Leakage. Maaaring makuha ang mga system prompt, nakatagong instruction at iba pang context na hindi dapat makita ng user, kaya nalalantad ang mga panuntunan, lohika o lihim na inilagay roon.

  9. LLM09
    Mga Kahinaan sa Vector at Embedding

    Dahil sa mga depekto sa paggawa, pag-iimbak at pagkuha ng mga embedding, maaaring magpasok ng content ang mga attacker, maglabas ng data sa pagitan ng mga tenant o makuha muli ang source text. Pinakamalaki ang epekto nito sa mga RAG system.

  10. LLM10
    Hindi Ligtas na Pangangasiwa sa Output

    Umaabot ang output ng model sa mga browser, shell, database o iba pang component nang walang validation o encoding, kaya nagiging posible ang XSS, SQL injection, code execution at data exfiltration.

Mga depensa

Labinlimang dokumentadong depensa, na bawat isa ay may link sa pinagmulan nito. Gumamit ng ilang patong ng depensa dahil walang iisang depensang kayang pumigil sa lahat ng pag-atake.

Putulin ang nakamamatay na tatluhang ito

Panuntunan ni Simon Willison: maaaring gamitin laban sa iyo ang anumang tekstong binabasa ng isang agent kung kaya nitong magbasa ng pribadong data, nakakakita ito ng hindi pinagkakatiwalaang content at nakakapagpadala ito ng data palabas. Alisin ang kahit isa sa tatlong ito sa bawat agent o session. Halimbawa, huwag bigyan ng mga sikreto ang agent na nagsusuri ng mga pampublikong issue, at huwag bigyan ng outbound channel ang agent na may hawak ng mga sikreto.

simonwillison.net

Limitahan ang agent pagkatapos ng hindi pinagkakatiwalaang input

Iisa ang tuntunin sa pananaliksik tungkol sa mga design pattern para sa seguridad ng agent: kapag nakatanggap na ang agent ng hindi pinagkakatiwalaang input, hindi ito dapat makapagpasimula ng mga aksyong may malaking epekto. Kabilang sa mga pattern ang action-selector, plan-then-execute, dual LLM at context minimisation. Pumili ng isa para sa bawat workflow; halimbawa, pagtibayin muna ang plano bago magbasa ang agent ng anumang hindi pinagkakatiwalaang data.

arxiv.org

Subaybayan ang daloy ng data gamit ang CaMeL

Hinahati ng CaMeL sa dalawa ang agent: nagsusulat ng code ang isang privileged planner batay sa kahilingan ng user, habang humahawak naman ng hindi pinagkakatiwalaang data ang isang quarantined model. May capability tag ang mga value mula sa quarantined na bahagi, at sinusuri ng mga policy ang mga tag na iyon bago patakbuhin ang anumang tool. Sa paper, nalutas nito ang 77% ng mga AgentDojo task nang may mapapatunayang seguridad, kumpara sa 84% para sa agent na walang proteksiyon.

arxiv.org

Gumamit ng mga credential na may pinakamababang pribilehiyo

Bilang default, bigyan ang mga agent ng read-only na access na limitado sa proyekto at huwag silang bigyan ng admin o service_role key, na nagbi-bypass sa row-level security sa Supabase. Limitahan ang mga CI at repository token sa iisang trabahong kailangan ng mga ito. Natunton sa isang GitHub token na may sobrang lawak na access sa CodeBuild ang insidente sa Amazon Q Developer.

supabase.comaws.amazon.com

Humingi ng pag-apruba para sa mga aksyong may malaking epekto

Atasan ang isang tao na kumpirmahin ang mga tool call na sumusulat, nagtatanggal, nagpapadala o gumagastos, at tanggihan ang mga ito bilang default kapag walang sumagot. Inirerekomenda ng Supabase ang manu-manong pag-apruba sa mga MCP tool call. Sa OpenClaw, itakda ang tools.exec.ask sa always at panatilihing deny ang askFallback. Ipakita ang lahat ng argumento para makita ng tagasuri kung ano talaga ang tatakbuhin.

supabase.comdocs.openclaw.ai

I-sandbox ang code at pagpapatakbo ng tool

Patakbuhin ang mga shell command at nabuong code sa container o VM na walang hawak na credential at workspace lang ang naa-access. Naka-off bilang default ang sandboxing ng OpenClaw, at nakatakda sa full ang tools.exec.security sa mga gateway host. Kaya i-on ang sandboxing, itakda ang exec security sa deny o allowlist, itakda sa true ang fs.workspaceOnly at panatilihing naka-disable ang elevated mode. Kumpirmahin ang resulta gamit ang openclaw sandbox explain.

docs.openclaw.aidocs.openclaw.ai

Limitahan ang papalabas na access sa network

Bilang default, harangin ang papalabas na trapiko mula sa mga agent at MCP server, at saka payagan lang ang mga host na kailangan ng bawat isa. Huwag awtomatikong aprubahan ang mga fetch sa mga multi-tenant host kung saan puwedeng mag-publish ang sinuman. Ganito naging channel ng exfiltration ang huggingface.co sa CVE-2026-54316. Dapat makakonekta lang ang email server sa mail API nito at wala nang iba, gaya ng ipinakita ng postmark-mcp.

nvd.nist.govkoi.ai

Huwag ilantad sa internet ang mga control plane

I-bind sa loopback ang mga agent gateway, dashboard at debug proxy, at mangailangan ng token na hindi bababa sa 24 na character, halimbawa, mula sa openssl rand -hex 32. Gumamit ng SSH tunnel o Tailscale Serve para ma-access ang mga ito nang malayuan, at gamitin lang ang Tailscale Funnel kapag may password auth. Regular na patakbuhin ang openclaw security audit --deep.

docs.openclaw.aidocs.openclaw.aidocs.openclaw.ai

I-validate ang audience ng MCP token

Inaatasan ng MCP authorisation spec ang server na tanggihan ang mga access token na hindi para rito inilabas, at ipinagbabawal nitong ipasa ang token ng client sa upstream API. Nagpapadala ang mga client ng RFC 8707 resource indicator para maitali ang bawat token sa iisang server. Kailangang kumuha ng pahintulot ang proxy server mula sa bawat client; kung hindi, magiging confused deputy ito.

modelcontextprotocol.iomodelcontextprotocol.io

Ihiwalay ang mga MCP session at tenant

Gumawa ng hiwalay na server at transport instance para sa bawat session sa halip na magbahagi ng iisang instance sa lahat ng client. Itali ang bawat session at task sa authenticated principal na gumawa nito, at tiyakin ang pagkakatali sa bawat request. Nagmula ang dalawang MCP SDK advisory noong 2026 sa shared o hindi nakataling state.

github.comgithub.com

Siyasatin ang mga skill, plugin at MCP server

I-pin ang eksaktong mga bersyon, basahin ang diff bago ang bawat update, at tingnan ang mga resulta ng scanner gaya ng VirusTotal at ang status ng security audit sa ClawHub. I-hash ang mga paglalarawan ng tool kapag nag-apruba ka ng server, at magbabala kapag nagbago ang mga ito para matukoy ang mga rug pull. Walang built-in na pagharang ang OpenClaw sa oras ng pag-install, kaya ikaw mismo ang magtakda ng security.installPolicy.

openclaw.aidocs.openclaw.aiinvariantlabs.aidocs.openclaw.ai

Kontrolin kung sino ang puwedeng mag-message sa agent

Limitahan ang DM access sa pairing o allowlist, at hingin na banggitin ang agent bago ito kumilos sa mga group chat. Itakda ang session.dmScope sa per-channel-peer para hindi magbahagi ng context ang mga sender. Sinumang makakapag-message sa agent ay maaaring sumubok na magbigay rito ng mga tagubilin, kaya bahagi ng attack surface mo ang listahan ng mga sender.

docs.openclaw.aidocs.openclaw.ai

Ilayo ang mga secret sa hindi pinagkakatiwalaang CI run

Huwag magpatakbo ng agent na may repository secret sa mga workflow na puwedeng pasimulan ng mga tagalabas sa pamamagitan ng pull request, issue o comment. Ituring na mapaminsala ang mga title, description at comment mula sa mga event na iyon. Kung talagang kailangan ng isang hakbang ang mga secret, patakbuhin lang ito kapag naaprubahan na ng maintainer ang run.

oddguan.com

Ituring na hindi pinagkakatiwalaan ang output ng model

I-encode o i-sanitise ang output ng model bago ito i-render, at huwag itong ipasa nang walang pagsusuri sa shell, SQL query o browser. Harangin ang awtomatikong pag-load ng mga markdown image at link papunta sa mga external domain, at magtakda ng mahigpit na Content Security Policy. Nailabas ng EchoLeak ang data sa pamamagitan ng mga URL na kusang naglo-load.

genai.owasp.orgnvd.nist.gov

I-verify ang mga pirma ng agent bago magbigay ng pahintulot

Para matukoy ang agent na tumatawag sa site o API mo, i-verify ang Web Bot Auth signature nito gamit ang mga key na inilalathala ng operator sa /.well-known/http-message-signatures-directory. Lumalagda ang ChatGPT agent bilang Signature-Agent https://chatgpt.com. Ipinapakita ng valid na signature kung sino ang nagpapatakbo sa agent, hindi kung sinong user ang nagpadala ng request o kung ano ang pinapayagang gawin ng user na iyon. Kaya hiwalay na magbigay ng pahintulot sa bawat request.

datatracker.ietf.orghelp.openai.com

Mga tanong tungkol sa seguridad ng agent

Ano ang prompt injection sa mga AI agent?

Ang prompt injection ay text na itinuturing ng model na mga tagubilin kahit datos lang ito, halimbawa, mula sa web page, email o paglalarawan ng tool. Sa isang agent, maaari itong magpasimula ng mga tool call na gumagamit ng mga credential mo. Itinala ito ng OWASP bilang LLM01:2026, at saklaw ng Agent Goal Hijack (ASI01) ang anyo nito sa mga agent.

Ano ang lethal trifecta para sa mga AI agent?

Pangalan ito ni Simon Willison para sa isang agent na may access sa pribadong data, nakakakita ng hindi pinagkakatiwalaang content at may paraan para makipag-ugnayan sa labas. Kapag naroon ang tatlo, maaaring basahin ng prompt injection ang data mo at ipadala ito sa labas. Isang klasikong halimbawa nito ang pagtagas ng MCP token ng Supabase noong 2025.

Paano ko poprotektahan ang isang MCP server?

Tanggihan ang mga access token na hindi inilabas para sa server mo, at huwag kailanman ipasa ang token ng client sa upstream API. Gumawa ng hiwalay na server at transport instance para sa bawat session, at iugnay ang mga session at task sa authenticated na user. Gamitin ang TypeScript SDK na bersyong 1.26.0 o mas bago at ang Python SDK na bersyong 1.27.2 o mas bago para maiwasan ang pagtagas ng response sa pagitan ng mga client at ang pag-hijack ng session.

Mapipigilan ba ng mas mahusay na system prompt ang prompt injection?

Huwag umasa rito. Ayon sa pananaliksik sa mga design pattern para sa mga agent, kapag nakapasok na sa agent ang hindi pinagkakatiwalaang input, dapat itong higpitan para hindi makapagpasimula ang input ng mga aksiyong may malaking epekto. Nalutas ng CaMeL, na nagpapatupad nito sa pamamagitan ng pagsubaybay sa mga capability, ang 77% ng mga task sa AgentDojo nang may napapatunayang seguridad; nakakuha naman ng 84% ang agent na walang depensa.

Ano ang pagkakaiba ng OWASP LLM Top 10 at Agentic Top 10?

Saklaw ng OWASP Top 10 for LLM Applications, na inilabas ang 2026 edition noong 4 August 2026, ang mga panganib sa anumang application na binuo gamit ang language model. Saklaw naman ng OWASP Top 10 for Agentic Applications, na inilabas noong 9 December 2025, ang mga pagbabagong dulot ng kakayahan ng model na magplano, gumamit ng mga tool, magpanatili ng memory at makipag-ugnayan sa ibang agent. Karaniwang kailangan ng mga gumagawa ng agent ang dalawa.

Ligtas bang ilantad sa internet ang OpenClaw gateway?

Hindi. Panatilihin ang default na loopback ng gateway.bind, at gumamit ng SSH tunnel o Tailscale Serve kung kailangan mo ng remote access. Nakatala ang 192,492 nakalantad na gateway sa OpenA2A noong 1 September 2026, at ipinakita ng CVE-2026-25253 na kailangang agad mag-install ng patch kahit ang mga installation na loopback lang ang gamit.

Mga source

  1. genai.owasp.org/resource/owasp-top-10-for-agentic-applications-for-2026/
  2. genai.owasp.org/download/52117
  3. genai.owasp.org/resource/owasp-genai-llm-top-10-2026/
  4. github.com/GenAI-Security-Project/GenAI-LLM-Top10

Independent na sanggunian para sa mga gumagawa ng AI agent. Hindi kami kaanib ng alinman sa mga vendor na nakalista rito.

© 2026 DotsAgent · Sinuri ang mga detalye noong Oktubre 1, 2026