
Google เพิ่งรวมความสามารถ Computer Use เข้าเป็นเครื่องมือในตัว (built-in tool) ของ Gemini 3.5 Flash โดยตรง ทำให้ AI สามารถเห็นหน้าจอ คิดวิเคราะห์ และลงมือคลิก พิมพ์ หรือเลื่อนหน้าจอได้เองโดยไม่ต้องให้คนสั่งทุกขั้นตอน นักพัฒนาสามารถเริ่มใช้งานได้ทันทีผ่าน Gemini API และ Gemini Enterprise Agent Platform ตั้งแต่วันที่ 24 มิถุนายน 2026
ถ้าเคยใช้ Gemini เพื่อถามข้อมูลหรือสรุปเอกสาร นั่นคือ AI ที่ “พูด” เป็น แต่ Computer Use คือการก้าวข้ามจุดนั้น เมื่อ AI สามารถ “ทำ” ได้ด้วยตัวเอง ลองนึกภาพว่าคุณแค่บอกว่า “ช่วยตรวจสอบว่าเว็บไซต์เราแสดงผลถูกต้องในทุกหน้าไหม” แล้ว AI จะเปิดเบราว์เซอร์ เข้าไปคลิกทีละหน้า บันทึกผลลัพธ์ และส่งรายงานกลับมาให้คุณเองโดยอัตโนมัติ
ก่อนหน้านี้ความสามารถนี้มีเฉพาะใน Gemini 2.5 Computer Use ซึ่งเป็นโมเดลแยกต่างหาก ต้องเข้าถึงผ่านช่องทางพิเศษ การรวมเข้ามาใน 3.5 Flash หมายความว่านักพัฒนาที่ใช้ Flash อยู่แล้วไม่ต้องสลับโมเดล ได้ความสามารถนี้ทันที Flash ยังมีข้อได้เปรียบด้านความเร็วและต้นทุนที่ต่ำกว่า ทำให้การนำ AI agent ไปใช้จริงในระดับองค์กรทำได้ง่ายขึ้นมาก
ระบบนี้ทำงานได้ทั้งบน browser, แอปมือถือ และ desktop application ครอบคลุมกรณีใช้งานจริงได้หลากหลาย ตั้งแต่ทดสอบซอฟต์แวร์อย่างต่อเนื่อง ไปจนถึงงานเอกสารที่ต้องเปิดหลายโปรแกรมพร้อมกัน
การให้ AI ควบคุมคอมพิวเตอร์มาพร้อมความเสี่ยงที่ต้องจัดการ โดยเฉพาะการโจมตีแบบ “prompt injection” ที่ผู้ไม่หวังดีอาจฝังคำสั่งซ่อนไว้ในหน้าเว็บหรือเอกสาร เพื่อหลอกให้ AI ทำสิ่งที่ไม่ได้รับอนุญาต Google แก้ปัญหานี้ด้วยการฝึกโมเดลด้วยข้อมูลโจมตีจำลอง (adversarial training) เพื่อให้ระบบรู้จักและต้านทานการหลอกลวงรูปแบบนี้ได้
นอกจากนี้ยังมีระบบป้องกันเสริม 2 ชั้นที่องค์กรเปิดใช้ได้ตามต้องการ ชั้นแรกคือขอให้ผู้ใช้กด “ยืนยัน” ก่อนทุกครั้งที่ AI จะทำสิ่งที่ย้อนกลับไม่ได้ เช่น ลบไฟล์หรือส่งอีเมล ชั้นที่สองคือหยุดการทำงานทันทีหากระบบตรวจพบว่า AI กำลังถูกหลอกด้วย prompt injection จากภายนอก Google แนะนำให้ใช้ทั้งสองชั้นนี้ร่วมกับ sandboxing และการตรวจสอบโดยคนเพื่อความปลอดภัยสูงสุด
สำหรับนักพัฒนาที่อยากลองโดยไม่ต้องเขียนโค้ดทันที Browserbase เปิด demo environment ให้ทดสอบได้ฟรี ส่วนผู้ที่พร้อมสร้าง agent จริงสามารถเข้าไปอ่าน reference implementation บน GitHub และเอกสาร API ได้เลย บริษัทอย่าง UiPath และ Browser Use ที่เป็นผู้ใช้งานในกลุ่มแรกต่างยืนยันว่าระบบใช้งานได้จริงในระดับ production แล้ว
Computer Use ใน Gemini 3.5 Flash สะท้อนทิศทางที่ชัดเจนว่า Google ไม่ได้มองว่า AI agent เป็นแค่เทคโนโลยีในแล็บอีกต่อไป การฝังความสามารถนี้ลงใน Flash โมเดลที่นักพัฒนาทั่วไปเข้าถึงได้ในราคาย่อมเยา คือสัญญาณว่ายุคของ AI ที่ลงมือทำงานแทนคนกำลังเริ่มต้นอย่างจริงจัง
ข้อมูลจาก: Google The Keyword