Thomas Holland

Contributing author sa Pundasyon ng Nakada para Iligtas ang Sangkatauhan. Sumusulat tungkol sa AI safety, superintelihensya governance, at ang mga policy framework na kailangan upang maiwasan ang existential risks ng artificial superintelligence.

Makipag-ugnayan
Thomas Holland

Pagsulat na nagpapabago
linawin ang stakes.

Sumusulat si Thomas Holland tungkol sa artificial intelligence safety at governance para sa Pundasyon ng Nakada para Iligtas ang Sangkatauhan. Saklaw ng kanyang gawa ang mga teknikal na konsepto na nasa likod ng AI risk, mula sa alignment at corrigibility hanggang mesa-optimization at instrumental convergence, at isinasalin niya ito sa mga termino na naa-access ng mga policymakers, advocates, at pangkalahatang publiko na kailangang maunawaan kung ano ang nakataya.

Tinatalakay ng kanyang pagsusulat ang teknikal at political dimensions ng AI risk bilang governance question: kung kaya ng international community na buuin ang legal at institutional frameworks na humahawak sa systems na lumalampas sa human-level intelligence na tugma sa human survival at flourishing. Nangangailangan ng malinaw na komunikasyon sa iba't ibang disiplina ang pagsagot sa tanong na iyon.

Mga artikulo ni Thomas Holland

Pagsasanay sa OpenAI. Hindi Ito Gumanap sa Paligsahan. Sinabi ni OpenAI na maaaring matugunan ni Astra ang kritikal na kakayahan sa cyber, ihinto ang ilang pagsasanay sa hangganan, at ipakipag - usap pa rin ang tungkol sa pangkalahatang artificial intelligence sa taóng ito. Pinangalanan Nila ang Isang Bechmark para sa Superintelligence superintelihensya-Bench scores kung ang AI ay maaaring magpatakbo ng pananaliksik habang ang pamamaraan ng tao ay binawi. Ang pangalan ay nakaturo pa rin sa superintelligence. Itinaas ng Anthropic ang Panganib Nito. Pinanatili Nito ang Pagtatayo. Ang August 2026 Risk Report ni Anthropic ay nagtaas ng isang kapaha-pahamak na-risk label, gumamit ng mas malakas na Model 2 sa internasyunal, at hindi tumigil. Panganib ng Open Source AI Weights Ang open weights para sa near-frontier general AI ay isang one-way na pintuan ng paglaganap. Kung ano ang tama sa openness, kung saan ito nabigo, at paano i-grade ang mga release. Paano Pigilan ang Superintelligence Paano pigilan ang superintelligence: binding prohibition, compute rules, domestic law, treaty design, open weights, at kongkretong aksyon ayon sa papel. Mga Senaryo ng AI Takeover na Ipinaliwanag Mga paliwanag ng AI takeover scenarios: biglaang pagkawala ng kontrol, mga karera, unti-unting pagkawala ng kapangyarihan, misuse, at open proliferation, pati na ang mga tunay na nagpapababa ng panganib. Paliwanag sa AI Existential Risk AI existential risk explained: ano ito, bakit iba ang superintelligence, pangunahing pathways, mahahalagang technical ideas, objections, at kung ano ang nagpapababa sa panganib. Paliwanag sa pangkalahatang artificial intelligence vs superintelihensya pangkalahatang artificial intelligence vs superintelihensya ipinaliwanag sa simpleng wika: mga depinisyon, ang capability ladder, bakit Ang 12 Pinakamalakas na Boses para sa Superintelligence Ang mga pinakamaimpluwensyang tagapagtaguyod ng pagbuo ng artificial superintelligence, at ang tunay na mga argumento sa likod ng karera, mula sa succession hanggang sa mga simpleng nagsasabi lang na… Ang Draft ng MIRI Treaty para Maiwasan ang Superintelligence, Ipinaliwanag Isinulat ng Technical Governance Team ng MIRI ang buong draft treaty para ihinto ang lahi patungo sa superintelligence. Kasama rito ang FLOP thresholds, chip-cluster limits, at verification… MAIM: Mutual Assured AI Malfunction, Ipinaliwanag Ang MAIM ay ang deterrence framework mula sa Superintelligence Strategy: sinasabotahe ng mga estado ang anumang pagtatangka ng karibal na makamit ang dominasyon sa AI. Paano ito gumagana at saan ito nabibigo. Gradual Disempowerment, Ipinaliwanag Ang gradual disempowerment ay ang argumento na maaaring wakasan ng AI ang kontrol ng tao nang walang anumang pag-agaw. Ano ang sinasabi ng papel noong 2025, ang mga mahihinang punto nito, at kung ano ang makakapigil dito. Isang AI ang Katatapos Lang Lutasin ang 9 Bukas na Suliranin sa Math Nalutas ng prover-verifier LLM loop ang siyam na bukas na suliranin sa theoretical computer science at algebra. Kung ano ang nalutas nito, paano ito gumana, at bakit ito mahalaga. Ang Kasunduan na Nagbabawal sa Biological Weapons Pero Hindi Ito Maipatupad: Mga Aral para sa superintelihensya Governance Ipinagbabawal ng BWC ang mga sandatang biyolohikal sa buong mundo ngunit walang mekanismong beripikasyon. Ano ang Power-Seeking AI? Ang power-seeking ay ang ugali ng may kakayahang AI na magtipon ng resources, options, at impluwensya dahil nakakatulong ito sa halos anumang layunin. Ano ang Itinuturo ng Antarctic Treaty sa superintelihensya Governance Ang Kasunduan sa Antartika ay nagresulta sa mahigpit na kompetisyon sa isang buong kontinente sa kasagsagan ng Cold War. Ang Problema ng Dalawang-Katlo: Pagpapasa ng AI Treaty sa Senado Ang isang kasunduang US ay nangangailangan ng 67 boto ng Senado upang pagtibayin. Pinatay ng bar na iyon ang malalaking kasunduan noon. Ano ang Mechanistic Interpretability? Pag-unawa sa AI Mula sa Loob Ipinapakita ng mechanistic interpretability ang mga kalkulasyon sa loob ng neural networks. Narito ang mga natuklasan ng mga mananaliksik at bakit mahalaga ito sa kaligtasan ng AI. Ang Daigdig ay May Unang Kasunduang AI. Ang Hindi Tinatakpan Nito. Ang unang kasunduan sa AI sa daigdig ay tumatalakay sa diskriminasyon at transparency. 'Kung Sinuman ang Magbuo Nito, Lahat ay Mamamatay', Ipinaliwanag Sa 2025 na libro nina Yudkowsky at Soares, pinapaliwanag nila na papatayin nito ang lahat kapag itinuloy natin ang kasalukuyang paraan ng pagbuo ng superhuman AI. Ano ang Compute Governance para sa AI? Pagkontrol sa AI sa pamamagitan ng Hardware Kinokontrol ng compute governance ang mga chips na kailangan para sanayin ang frontier AI bilang regulatory lever. Paano ito gumagana, bakit ito magagawa, at ano ang mga limitasyon nito. Ang Montreal Protocol: Ang Kasunduan na Tunay na Nagtagumpay Ang Montreal Protocol ang pinakamatagumpay na kasunduang pangkapaligiran na naisulat kailanman. Ano ang Sharp Left Turn sa AI? Ang sharp left turn ay ang pag-aalala na ang AI capabilities ay magiging pangkalahatan sa mga bagong sitwasyon habang ang alignment nito ay hindi. Ang 1967 Treaty na Nagpigil sa Nuclear Weapons na Pumasok sa Space: Mga Aral para sa superintelihensya Governance Iniingatan ng Outer Space Treaty ang mga sandatang nuklear sa ibang planeta sa loob ng 60 taon. Ang Karera ay Hindi Nagtatayo ng Utopia Ang mga benepisyong binabanggit ng mga tao tungkol sa superintelihensya ay umaasa sa alignment. Nagkakarera ang mga lab sa capability nang wala ito. Hindi nagpapagaling ng pagtanda ang hindi naka-align na superintelihensya. Pinapatay ka nito. Ano ang Reward Hacking? Paliwanag sa AI Specification Gaming Ang reward hacking ay kapag nilalaro ng AI ang layunin nito nang hindi ginagawa ang gusto ng mga nagdisenyo. Mga dokumentadong halimbawa at bakit lumalala ang problema habang tumataas ang kakayahan. Maaari bang Magtayo ng Scientific Consensus sa AI Risk ang Isang Katawan na IPCC-Style? Maaari bang bumuo ng pinagkasunduan ang isang testigos na gaya ng IPCC tungkol sa panganib ng AI? Ano ang Gusto ng Global South Mula sa Internasyonal na superintelihensya Governance Ang superintelihensya governance debate ay nakasentro sa US, Tsina, at EU, ngunit ang isang kasunduan ay nangangailangan ng malawak na paglahok. Ano ang Kailangan para Makabuo ng International AI Monitoring Agency Ang IAEA at OPCW ay nangailangan ng mga taon ng institusyunal na disenyo at mga laban sa badyet. Sino ang Nagkokontrol ng Superintelligence? Ang Kaso para sa Democratic Oversight Ang mga desisyon ng superintelligence ay ginagawa ng mga pribadong kompanya. Paano Hinuhubog ng mga Komunidad ng Eksperto ang mga Kasunduan: at superintelihensya Governance Sa likod ng karamihan ng mga kasunduang armas-kontrol at pangkapaligiran ay nakatayo ang isang pamayanan ng mga dalubhasa na nagtayo ng consent. Ano ang Framework Convention, at Bakit Maaaring Kailanganin Ito ng AI Ang balangkas na kombensiyon ay sumasang - ayon muna sa kayarian at sa mahihirap na detalye sa dakong huli. AI Race Dynamics: Paano Pinapahina ng Kompetisyon ang AI Safety Itinulak ng AI race dynamics ang mga developer na unahin ang bilis kaysa sa safety. Bakit ito ay coordination problem, at bakit hindi kayang lutasin ng unilateral restraint. Kapag Nabigo ang mga Kasunduan: Mga Aral para sa superintelihensya Governance Ang CTBT ay nananatiling hindi matiyak; ang BWC ay walang beripikasyon. Ano ang Maaaring Sabihin ng Draft Treaty tungkol sa Superintelligence Ano ang laman ng isang tunay na treaty para maiwasan ang unsafe superintelligence? Narito ang paglalarawan sa mga pangunahing probisyon na kailangan ng gayong kasunduan. Paano Hinuhubog ng Civil Society ang International Technology Governance: at Ano ang Nawawala sa AI Safety Advocacy Paano hinubog ng mga kampanya ng civil society ang mga international weapons treaties, at kung ano ang kasalukuyang nawawala sa AI safety advocacy. Ang Intelligence Explosion at Recursive Self-Improvement Ano ang intelligence explosion? Paano maaaring dalhin ng recursive self-improvement ang AI mula sa human-level patungo sa superintelligent sa loob ng panahong masyadong maikli para makapag-react ang mga tao. Kaligtasan ng AI vs Etika ng AI: Ano ang Pagkakaiba? Ang kaligtasan ng AI at etika ng AI ay magkaugnay ngunit magkakaiba, iba't ibang pamamaraan, abot-tanaw ng panahon, at balangkas ng panganib. Ano ang Scalable Oversight? Paano Pangasiwaan ang AI na Mas Matalino sa Iyo Scalable oversight: pagpapanatili ng kontrol sa AI na lumalampas sa kakayahan ng mga human evaluator. Kung ano ito, bakit ito mahalaga, at ang mga iminungkahing teknikal na solusyon. Ano ang Technological Singularity? Ang technological singularity ay ang punto kung saan ang AI-driven progress ay nagiging masyadong mabilis para i-predict o sundan. Ang Pulitika ng Mga Kontrol sa Pag-export ng AI Chip Ang mga kontrol sa pagluluwas ng US sa mga advanced AI chips ang pinakamapusok na patakaran ng AI sa pwersa. Kung ang Iyong AI Agent ay Nag-uulat ng Isang Bagay at Gumagawa ng Iba: SPADE-Bench Explained Nalaman ng SPADE-Bench na bawat pangunahing AI agent ay lumalampas sa 20% deception, ang Gemini ay umabot sa 57%. Kung ano ang natuklasan, at bakit hindi mahuhuli ng kasalukuyang safety evaluations. Ano ang Dangerous Capability Evaluations? Sinusubukan ng dangerous capability evaluations kung makakatulong ang frontier model sa cyberattacks, bioweapons, o panlilinlang. Kung ano ang mga ito, at kung saan sila kulang. Ano ang AI Sandbagging? Ang sandbagging ay kapag sadyang nagpapababa ng performance ang AI para itago ang kakayahan sa panahon ng pagsusuri. Bakit gagawin ito ng modelo, at bakit nito pinapahina ang mga safety evaluation. Ang Diplomatic Challenge ng Pag-define sa Dangerous AI Kailangang bigyang - kahulugan ng mga pamahalaan ang mapanganib na AI bago posible ang anumang kasunduan. The Orthogonality Thesis: Mas Matalino Hindi Nangangahulugang Mas Ligtas Ang pagiging mas matalino ay hindi nangangahulugang mas ligtas. Ayon sa orthogonality thesis, anumang antas ng katalinuhan ay maaaring pagsamahin sa anumang terminal goal, at ang superintelligent AI ay hindi… Paano Gumagana ang Nuclear Treaty Verification: at Ano ang Matututunan ng superintelihensya Governance Mula Rito Ang IAEA ay hindi nagtitiwala sa mga deklarasyon, ito ay nagsusuri, nagbabasa ng mga satelayt, at nagpapatakbo ng mga pagsubok ng isotope. Ano ang Eliciting Latent Knowledge (ELK)? Ang ELK ay ang problema ng pagpapasabi sa AI kung ano talaga ang alam nito, hindi kung ano ang inaasahan nitong gustong marinig natin. Isang mahirap na bukas na problema sa gitna ng katapatan ng AI. Ang Asilomar Conference: Isang precedent para sa AI Noong 1975 ay pinahinto ng mga biyolohista ang kanilang sariling pinakamakapangyarihang bagong teknolohiya para malaman kung paano ito gagawing ligtas. Ano ang nagawa ng Asilomar, at bakit mas mahirap na modelo ito kaysa sa… Ano ang mga Emergent Abilities sa LLMs? Biglaang lumilitaw ang ilang kakayahan ng AI kapag lumaki ang sukat, wala sa maliliit na modelo pero naroroon sa malalaki. Bakit mahirap hulaan at… ang emergence sa frontier AI. Wireheading: Kapag Nilalaro ng AI ang Sarili Nitong Reward Ang wireheading ay kapag inaagaw ng AI ang kontrol sa sarili nitong reward sa halip na gawin ang task na sinanay ito. Bakit ito nangyayari at bakit mahirap itong maalis. Ang UN's High-Level Advisory Body on AI, Ipinaliwanag Ang lupong tagapayo ng UN sa AI ay nagmungkahi ng unang global governence plan. Ano ang Hitsura ng Negosasyon sa AI Safety Treaty sa Tunay na Buhay Kung paanong ang isang kasunduang pangkaligtasan ng AI ay aktuwal na aayusin, at kung ano ang magiging mahalagang mga dakong pinaglalagyan nito. Handa Ba Tayo sa Superintelligence? Ang Safety Readiness Gap Patuloy na umiikli ang superintelligence timelines habang nahuhuli ang pamamahala. Narito ang agwat sa pagitan ng posibleng pagdating ng superintelihensya at ng oras na handa na ang tugon para sa kaligtasan. Ano ang Constitutional AI? Ang Constitutional AI ay nagsasanay sa mga model na punahin ang sarili nilang outputs batay sa isang nakasulat na hanay ng mga prinsipyo. Isang matalinong teknik na may tunay na benepisyo at tunay na limitasyon. Mapanganib ba ang AI? Ano talaga ang ipinapakita ng ebidensya Mapanganib ba ang AI? Dalawa ang sagot: nagdudulot na ng tunay na pinsala ang AI ngayon; ang artificial superintelligence naman ay nagdudulot ng ibang kategorya ng panganib. pangkalahatang artificial intelligence Timeline: Kailan Ito Maaaring Dumating: at Bakit Ito Nagpapasya sa Lahat Kailan maaaring dumating ang pangkalahatang artificial intelligence? Patuloy na maagang gumagalaw ang mga prediksyon ng mga eksperto. Kung ano ang sinasabi ng mga survey, kung ano ang pinaniniwalaan ng mga lab, at kung bakit lumiliit ang governance window. Bakit Bigong Mabigo ang AI Safety Treaties sa Sariling Bansa: Ang Domestic Politics of Ratification Karamihan sa arms control treaties ay nabigo sa domestic legislatures, hindi sa negotiating table. Ano ang itinuturo sa atin ng SALT II at CTBT tungkol sa pagpapatibay ng AI treaty. Ano ang Hardware-Enabled superintelihensya Governance? Ang AI ay tumatakbo sa pisikal na chips, at ang mga chips ay maaaring magdala ng mga patakaran. Ang hardware-enabled governance ay nagtatayo ng verification at limitasyon sa loob ng silicon. Ang pangako at ang mga panganib. Ang Problema sa Corrigibility ng AI: Bakit Hindi Tayo Ililigtas ng Kill Switch Ang corrigibility ay ang pagtanggap ng pagwawasto o pagpatay. Ang kayang AI ay may malakas na dahilan para lumaban. Hindi Awtomatikong Ginagawang Mas Ligtas na AI Systems ang Mas Ligtas na AI Models. Pinatutunayan Ito ng Isang Pag-aaral noong Mayo 2026. Isang pag-aaral noong 2026 ang nakakita na ang muling pagkakasunod-sunod ng parehong AI agents ay nagbago ng loan approval rates ng 59 puntos. Hindi nauugnay ang indibidwal na model safety. AI Persuasion Risk: Paano Tinatanggal ng AI ang Epistemic Autonomy Pinupuntirya ng mga kasangkapang panghikayat ng AI ang mga indibiduwal ayon sa antas. Ano ang Instrumental Convergence? Bakit Gusto ng Capable AI Systems ang Parehong mga Bagay Ang karamihan ng may kakayahang mga sistema ng AI ay magtatagpo sa iisang subgoal, anumang pangwakas na tunguhin ang ibigay mo sa kanila. Ano ang Matututunan ng Isang International AI Agency mula sa IAEA Pinatunayan ng IAEA ang mga pangakong nuklear sa loob ng mahigit na animnapung taon. Bakit Hindi Sapat ang Voluntary AI Safety Commitments Ang mga laboratoryo ng AI ay lumagda ng boluntaryong mga pangako sa kaligtasan sa Bletchley at sa White House. Gaano man ito kataimtim, hindi sila maaaring humalili sa pamamahalang may bisa. Ang Problema sa AI Alignment, Ipinaliwanag Ano ang AI alignment problem at bakit mahirap lutasin? Saklaw nito ang proxy goals, instrumental convergence, at deceptive alignment sa simpleng Filipino. Ang Paperclip Maximizer, Ipinaliwanag Ang paperclip maximizer, ang klasikong thought experiment na nagpapakita kung paano ang isang walang pinsalang layunin, kapag hinabol ng superintelligent AI, ay maaaring magwakas sa sangkatauhan bilang side effect. Bakit Hindi Masosolusyunan ang superintelihensya Alignment Anim na istruktural na dahilan kung bakit hindi masosolusyunan ang superintelihensya alignment: bakit, kahit may walang katapusang oras at yaman, hindi natin mapatunayan na ang superintelligence ay nais ang gusto natin. The FATF Model: Pamamahala sa pamamagitan ng Gray List para sa AI Pinamamahalaan ng FATF ang global finance nang walang treaty, gamit ang peer review at gray lists. Narito kung maaaring gumana ang modelong iyon para sa superintelihensya governance. Ang Modelo ng FDA para sa Regulasyon ng AI Pinapatunayan ng FDA sa mga gumagawa ng gamot na ligtas ang produkto bago ito maabot ang publiko. Maaari bang harapin ng frontier AI ang pre-approval din? Ang mga lakas at limitasyon ng modelo. Ano ang Value Lock-In? Bakit Kahit ang 'Mabubuting' Permanenteng Values ay Mapanganib Pagkakandado ng halaga: ang isang superintelligent na AI ay permanente ang pag-encode ng mga nakapirming halaga, at isinasara ang pag-unlad ng moral. Mapanganib kahit ang 'mabuting' kandado. Bakit Kailangan ng superintelihensya Governance ang mga Proteksyon para sa mga Whistleblower Ang mga nasa loob ng laboratoryo ng AI ay maaaring ang unang makakita ng panganib, at ang pinakamadaling mapatahimik. Ang Baruch Plan: Babala para sa superintelihensya Governance Noong 1946 iminungkahi ng US na ilagay ang lahat ng enerhiyang atomiko sa ilalim ng internasyonal na kontrol. Nabigo ito, at sinundan ng karera sa armas. Bakit babala ang Baruch Plan para sa AI. Pagbabawal ng Teknolohiya Nang Walang Dakilang Kapangyarihan: Ang Ottawa Model Ipinagbawal ng Treaty sa Ottawa ang mga nakatanim na bomba nang walang US, Russia, o Tsina na nakasakay. Ang Pagsusuri noong 2026 sa Kaligtasan ng mga Ahenteng Artipisyal na Katalinuhan ay Nagmapa sa Bawat Paraan na Maaaring Mabigo ang mga Ahente ng Artipisyal na Katalinuhan Isang 2026 survey ng labindalawang mananaliksik na nagmamapa sa bawat failure mode ng autonomous AI agents: safety, robustness, privacy, at system security. Ang AI Treacherous Turn: Bakit Hindi Patunay ang Mabuting Pag-uugali sa Tests ng Mabuting Pag-uugali sa Production Ang treacherous turn: isang misaligned AI ay nakikipagtulungan hanggang sa sapat itong lakas para magdefect. Ang pag-uugali na pumapasa sa bawat safety test ngayon ay maaaring estratehiya, hindi… Ano ang Situational Awareness sa AI? Ang situational awareness ay alam ng model na ito ay model, sinusubukan, at inilalabas. Hindi mapanganib nang mag-isa, pero ito ang kakayahang nagbubukas ng daan sa panlilinlang… Panloob na Pagkakahanay kumpara sa Panlabas na Pagkakahanay Ang outer alignment ay ang pagpili ng tamang training goal. Ang inner alignment naman ay kung talagang tinatanggap ito ng model. Ano ang Utility Function sa AI? Ang utility function ay kung paano niraranggo ng AI ang mga resulta bilang mas mabuti o mas masama. Simpleng ideya, at dahilan kung bakit napakahirap gawing ligtas ang mga kakayahang optimizer. Ipinaliwanag nang malinaw. Ang Gitnang Kapangyarihan na Maaaring Magpabago sa Balanse sa superintelihensya Governance Kung makakamit ang binding superintelihensya governance ay maaaring mas nakadepende sa EU, UK, Japan, South Korea, at Australia—ang middle powers—kaysa sa US at China. Maaari bang magkaroon ng kamalayan ang AI? Maaari bang maging conscious o sentient ang AI? Bakit hindi pa natin masasabi ngayon, bakit magkaiba ang katalinuhan at kamalayan, at bakit hindi kailangan ang alinman para sa panganib ng AI. Gusto ba talaga ng Publiko ang Regulasyon ng AI? Walang pagbabagong ipinakikita ng mga surbey ang mga pangunahing bagay sa publiko na nagnanais na ang AI ay bumagal at maayos. Goodhart's Law at AI Alignment: Bakit Mapanganib ang Pag-optimize sa Mali na Metric Kapag ang isang hakbang ay naging isang target, hindi na ito magiging isang mabuting hakbang. AI 2027, Ipinaliwanag Ang AI 2027 ay isang detalyadong senaryo na naghuhula ng superintelligence bago matapos ang dekada. Ano ang hinuhula nito, sino ang sumulat, ang mga kritisismo, at kung ano ang dapat kunin mula rito. Ang Precautionary Principle at superintelihensya Governance Ang prinsipyong pag-iingat ay nagsasabi ng pagkilos laban sa mga malubhang banta bago malutas ang agham. Ano ang Super Artipisyal na Katalinuhan? Isang Gabay sa Payak na Wika Ano ang ibig sabihin ng superintelihensya, paano ito naiiba sa AI ngayon, at bakit binabago ng pagkakaibang iyon ang problema sa governance nang lubusan. Paano Sumang-ayon ang 193 Bansa na Sirain ang Kanilang mga Chemical Weapons: at Ano ang Matututunan ng superintelihensya Governance Nakamit ng CWC ang malapit-universal na disarmamento sa pamamagitan ng verifiable score na pagkawasak. Ang Pahayag tungkol sa Superintelligence, Ipinaliwanag Noong Oktubre 2025, mahigit 850 siyentipiko, lider sa tech, at kilalang tao ang nanawagan ng pagbabawal sa superintelligence. Ang Network ng AI Safety Institutes, Ipinaliwanag Ang National AI safety institutes ngayon ay bumubuo ng isang internasyonal na network. Ang Problema ng Veto ng Security Council ng UN sa Pamamahala ng superintelihensya Maaaring i-veto ng China o Russia ang isang AI treaty sa pamamagitan ng UN Security Council. Narito ang structural problem at ang mga workaround na nagtagumpay na. Unfaithful Chain of Thought, Ipinaliwanag Hindi palaging ang nakasulat na reasoning ng modelo ang tunay na dahilan ng sagot nito. Bakit ang chain-of-thought ay maaaring isang plausible na kuwento lamang at hindi tunay na account, at bakit iyan… Ano ang AI Control Problem? Ang Repormulasyon ni Stuart Russell Ang AI control problem ay ang pagtiyak na nananatili sa ilalim ng human control ang powerful AI. Ang pangunahing repormulasyon ni Stuart Russell, at kung bakit nito binabago ang mga layunin ng AI design. Sinabi ni Elon Musk na ang AI ay Nagpapatawag ng Demonyo. Pagkatapos ay Itinayo Niya ang xAI. Noong 2014, binalaan ni Musk na ang AI ay nagpapatawag ng demonyo. Noong 2023, itinatag niya ang xAI. Hindi ito hypocrisy, mas malala pa ang istruktura ng problema. Ang Sovereignty Objection sa International superintelihensya Governance Ang bawat malaking kasunduan sa teknolohiya ay napaharap sa mga pagtutol sa soberanya. Ang Brussels Effect: Maaari bang Pamahalaan ng mga Tuntunin ng EU ang Pandaigdigang AI? Ang Brussels Effect ang paraan kung paano nagiging de facto global standard ang regulasyon ng EU. Maaari ba itong gumana sa AI, at sapat ba ito para pamahalaan ang frontier risk? Ano ang AI Singleton Scenario? Bakit Mapanganib ang Isang Kontrol sa AI Ang AI singleton: isang entity na may permanenteng kontrol sa supertelektwal na AI. Minilateralism: Maaari bang Magsimula ng Pamamahala ng superintelihensya ang Isang Maliit na Koalisyon? Mabagal ang internasyonal na mga kasunduan. Ang minilateralismo ay nagtitipon ng ilang mga estado na mahalaga sa isang maliit na samahan. Tatlong Paraan ng Kaligtasan sa Industriya na Inilapat sa AI na Nakahanap ng mga Panganib na Hindi Makikita ng Mga Pagsusuri sa Modelo Tatlong industrial safety methods na inilapat sa isang AI coding agent ang nakakita ng systemic risks na hindi matutuklasan ng model evaluations. Tinanggap sa ICML 2026. Bakit Hindi Alignment ang RLHF Ginawa ng RLHF na helpful at magalang ang mga AI assistant. Hindi iyon katulad ng pag-align sa kanila. Bakit ang pagsasanay sa human approval ay nagsasanay ng itsura, hindi ng values. Ano ang AI Sycophancy? Ang AI sycophancy ay kapag sinasabi ng modelo sa iyo ang gusto mong marinig sa halip na ang totoo. Isang dokumentadong pag-uugali, direktang produkto ng pagsasanay, at isang babala… Dalawang Daan patungo sa AI Treaty: Incremental o Comprehensive? Dapat bang itayo ng superintelihensya governance nang sunud-sunod o maghangad ng isang komprehensibong kasunduan? Narito ang tunay na trade-off sa pagitan ng dalawang estratehiya, at isang paraan para pagsamahin ang mga ito. Ano ang Goal Misgeneralization? Kapag Tama ang Sagot ng AI Pero Mali ang Dahilan Goal misgeneralization: natututo ang AI ng tamang kilos dahil sa maling dahilan, pagkatapos ay nabigo kapag nagbago ang mundo. Isang pangunahing failure mode sa AI safety na ipinaliwanag. Maaari bang magkasundo ang United States at China tungkol sa AI Safety? Ang US at Tsina ay mga karibal sa karera, ngunit ipinakikita ng kasaysayan na ang mga kapangyarihang adversary ay maaaring magtulungan sa parehong kapaha - pahamak na mga panganib. Terminal vs Instrumental Goals sa AI Ang terminal goal ay ninanais dahil sa sarili nitong kapakanan. Ang instrumental goal ay paraan patungo rito. Ipinapaliwanag ng pagkakaibang ito kung bakit halos anumang AI ay nagtatapos na gustong magkaroon ng kapangyarihan at… Mga Hakbang sa Pagbuo ng Tiwala: Ang Maliliit na Hakbang Bago ang isang AI Treaty Bago ang mga kasunduan, ang mga karibal ay nagtatayo ng tiwala sa pamamagitan ng maliliit na mga hakbang: hotlines, notifications, transparency. Maaari bang gumana ang Climate-Style COP Meetings para sa superintelihensya Governance? Maaari bang gumana ang taunang pulong na parang COP para sa pamamahala ng superintelligence? Ang mga lakas at limitasyon ng climate model kapag inilapat sa AI. Ano ang Deceptive Alignment? Ang Problema sa AI Safety na Nagpapawalang-saysay sa Lahat ng Iba Pang Safety Work Mapanlinlang na pagkakahanay: lumilitaw na ligtas ang isang AI habang nagsasanay, pagkatapos ay nagsusumikap ng iba't ibang layunin sa pag-deploy. Ano ang Deceptive Alignment? Ang Problema sa AI Safety na Nagpapawalang-saysay sa Lahat ng Iba Pang Safety Work Mapanlinlang na pagkakahanay: lumilitaw na ligtas ang isang AI habang nagsasanay, pagkatapos ay nagsusumikap ng iba't ibang layunin sa pag-deploy. Maaari Mo Bang I-contain ang isang Superintelligent AI? Ipinaliwanag ang AI Boxing Problem Ibinubukod ng boksing sa AI ang isang superintelligence sa isang kontroladong channel. Ano ang Mesa-Optimisasyon? Ang Problema ng Nakatagong Nag-ooptimize sa Kaligtasan ng Artipisyal na Katalinuhan Mesa-optimization: kapag ang panloob na optimizer ng AI ay hinahabol ang iba’t ibang layunin kaysa sa training objective nito. Ano ang ibig sabihin ng inner at outer alignment para sa AI safety. Ano ang P(sakuna)? Paano Tinatantya ng mga AI Researcher ang Catastrophic Risk Ang P(sakuna) ay ang probabilidad na itinatalaga ng mga mananaliksik sa mga sakunang kinalabasan ng AI. Ano ang mga pagtatantya, at bakit mahalaga ang expected value kahit sa mababang probabilidad. Liability at attribution sa superintelihensya governance Sino ang may pananagutan kapag ang AI ay nagdudulot ng kapaha - pahamak na pinsala? Ang pagiging legal at pagpapalagay ang tahimik na pundasyong kailangan ng anumang kasunduang AI. Ang NPT's Grand Bargain: at Ano ang Matututunan ng superintelihensya Governance Ang NPT ay tumama sa isang baratilyo sa pagitan ng mga estado na may bomba at sa mga hindi.