AI Agent下一站:จาก“การสร้าง”สู่“การลงมือทำ” X-Agent สำรวจระบบอัตโนมัติสำหรับงานจริง
Odaily รายงาน ขณะที่ “Vibe Coding” ช่วยให้ผู้คนจำนวนมากขึ้นสามารถสร้างแอปพลิเคชันด้วยภาษาธรรมชาติ การแข่งขันรอบต่อไปของ AI Agent กำลังเปลี่ยนไปสู่ปัญหาที่ยากขึ้น: จะทำงานจริงที่ข้ามแพลตฟอร์ม ข้ามบริการ และเกี่ยวข้องกับงบประมาณและการอนุญาตให้เสร็จสมบูรณ์ได้อย่างไร?
บทความล่าสุดของ X-Agent บน Medium เรื่อง “Beyond Vibe Coding, Toward Agentic Execution” ใช้ “การจองทริปโตเกียว” เป็นตัวอย่าง นำเสนอทิศทางการสำรวจสำหรับ Agentic Execution: ผู้ใช้ไม่จำเป็นต้องสลับไปมาระหว่างหน้าต่างๆ เช่น ตั๋วเครื่องบิน โรงแรม และการชำระเงินอีกต่อไป แต่ใช้ความต้องการเพียงประโยคเดียวเพื่อเริ่มต้นงาน โดยให้ AI ประสานงานการค้นหา เปรียบเทียบ ยืนยัน และดำเนินการต่อเนื่อง ผู้ใช้ยังคงควบคุมปลายทาง งบประมาณ เงื่อนไข และการอนุมัติขั้นสุดท้ายได้ตลอดเวลา
แต่ระหว่าง “การแนะนำตัวเลือก” ไปสู่ “การดำเนินการที่เชื่อถือได้” ยังคงมีความท้าทายด้านโครงสร้างพื้นฐานอีกชุดหนึ่ง การเปลี่ยนแปลงของราคา การยืนยันตัวตนเมื่อเข้าสู่ระบบ การหมดเวลาของคำสั่งซื้อ หรือการจองสำเร็จเพียงบางส่วน ล้วนกำหนดให้ Agent ต้องสามารถเก็บสถานะของงาน ระบุผลลัพธ์ที่ยืนยันแล้วและยังไม่ยืนยัน และหยุดชั่วคราวเพื่อขออนุญาตจากผู้ใช้ใหม่เมื่อจำเป็น แทนที่จะลองซ้ำอย่างไม่ลืมหูลืมตาหรือใช้จ่ายเงินอัตโนมัติ
围绕ในทิศทางนี้ X-Agent เสนอให้แยกความสามารถสี่ประเภท ได้แก่ บทสนทนา งาน การดำเนินการ และเหตุการณ์ มาทำงานร่วมกัน และสำรวจเส้นทางการดำเนินการที่หลากหลาย เช่น WebMCP, API, เครื่องมือ MCP, ระบบอัตโนมัติของเบราว์เซอร์ และ Computer Use หลักการสำคัญคือ: เครื่องมือช่วยให้ Agent ลงมือทำได้ แต่ไม่สามารถ bypass สิทธิ์ผู้ใช้ ข้อจำกัดด้านงบประมาณ และการตรวจสอบผลลัพธ์ได้
X-Agent ระบุว่าบทความในปัจจุบันอธิบายทิศทางผลิตภัณฑ์ที่ยังอยู่ระหว่างการสำรวจและตรวจสอบความถูกต้อง ไม่ใช่ความสามารถการจองทั่วไปที่เปิดให้บริการแล้ว เป้าหมายคือการผลักดันให้ AI ก้าวจาก “การเข้าใจและสร้าง” ไปสู่ “การทำงานให้เสร็จภายใต้การควบคุมของผู้ใช้” ทำให้ภาษาธรรมชาติกลายเป็นทางเข้าใหม่ที่เชื่อมโยงบริการในโลกจริงเข้ากับการดำเนินการในระบบดิจิทัล
