Xây dựng hệ sinh thái thông minh xúc giác toàn diện từ nhận thức xúc giác, thu thập dữ liệu đến trí tuệ nhân tạo.
Robot Chitose đã chính thức phát hành mô hình VTLA đầu tiên, X-TouchMind V1, và TacVerse 1k, bộ dữ liệu đa phương thức trực quan đầu tiên cho các tương tác vật lý thực tế.
Việc phát hành lần này đánh dấu việc hoàn thành xây dựng sinh thái công nghệ hoàn chỉnh từ hệ thống phần cứng xúc giác, hệ thống thu thập dữ liệu, đến tài sản dữ liệu và mô hình cụ, tiếp tục thúc đẩy trí tuệ xúc giác từ năng lực nhận thức tiến triển thành năng lực trí tuệ của robot.
01 cụ thân trí tuệ tiếp theo cửa ải: Từ khuôn mẫu hậu bổ, đến xúc giác nguyên sinh
Trong quá trình robot đi vào ứng dụng trong thế giới thực, chỉ dựa vào công nghệ thị giác đã khó đáp ứng nhu cầu nhiệm vụ phức tạp. Nhưng thông tin xúc giác bổ sung sau đó, thường phải trải qua đường dẫn ghép nối mới có thể dung nhập vào mô hình cụ thể hiện có, hạn chế giới hạn khả năng tương tác vật lý.
Đối mặt với điểm thẻ ngành nghề này, Thiên Giác cho rằng, xúc giác là mô hình then chốt để rô - bốt thực sự bước vào thế giới vật lý, phải dựa trên sinh thái nguyên sinh, xây dựng toàn bộ chỗ xoay quanh cảnh tượng tiếp xúc mạnh mẽ thực tế.
Do đó robot không chỉ có thể cảm nhận thế giới, mà còn có thể hiểu và hoàn thành ổn định các nhiệm vụ vật lý phức tạp.
X-TouchMind V1: Mô hình cảm ứng VTLA đầu tiên
X-TouchMind V1 là một mô hình xúc giác vật lý VTLA được đào tạo dựa trên dữ liệu đa phương thức visual haptic.
X-TouchMind V1 tập trung nhiều hơn vào trạng thái vật lý sau khi tiếp xúc xảy ra, mô hình hóa thống nhất các trạng thái hình ảnh, ngôn ngữ, xúc giác, hành động và bản thể robot, cho phép mô hình hóa hợp tác từ hiểu nhiệm vụ, tạo hành động đến kiểm soát phản hồi tiếp xúc.
Mô hình này sử dụng kiến trúc phân cấp tương ứng với các cấp độ khác nhau trong hoạt động robot thực tế:
Hệ thống 2: Lớp hiểu nhiệm vụ và suy luận ngữ nghĩa, chịu trách nhiệm hiểu môi trường, mục tiêu nhiệm vụ và hướng dẫn ngôn ngữ, trả lời "phải làm gì".
System 1: Lớp Action Generation và Track Planning (Lập kế hoạch theo dõi và tạo ra các đường dẫn hành động dựa trên hình ảnh, ngữ nghĩa nhiệm vụ và trạng thái robot) trả lời "làm thế nào".
Hệ thống 0: Lớp điều khiển tương tác xúc giác-bản thể, trong tiếp xúc thực tế sử dụng phản hồi xúc giác và bản thể để điều chỉnh tần số cao, trả lời "sau khi tiếp xúc làm thế nào để ổn định, làm chính xác"
Thông qua kiến trúc này, X-TouchMind V1 không chỉ có khả năng tạo ra các chuỗi hành động, mà còn hiểu được độ trượt, lực, biến dạng, kết cấu và độ ổn định tiếp xúc trong hoạt động thực tế và tự động điều chỉnh hành động, do đó cải thiện sự ổn định của robot trong các nhiệm vụ như vận hành tốt, xử lý vật liệu linh hoạt và kiểm tra chất lượng thông minh.
Đối với các nhiệm vụ liên lạc giàu có như đẩy, kéo, ép, cắm, đối vị và phục hồi, mục tiêu của X-TouchMind V1 không phải là cho phép robot thực hiện một bài thuyết trình hành động, mà là cho phép robot "làm tốt" một cách ổn định, đáng tin cậy và không phá hủy các tương tác vật lý phức tạp.
03TacVerse 1k: Bộ dữ liệu đa phương thức Vision Tactile chất lượng cao đầu tiên trong 1000 giờ
TacVerse 1k, được phát hành đồng bộ với X-TouchMind V1, là bộ dữ liệu đa phương thức Visual Tactile chất lượng cao 1000 giờ đầu tiên được xây dựng theo định hướng tương tác vật lý thực tế.
Về phía thu thập dữ liệu, TacVerse 1k dựa trên hệ thống phần cứng thu thập tự nghiên cứu để tách sản xuất dữ liệu ra khỏi cơ thể robot, cho phép tách công suất, tách cảnh và ghép kênh cơ thể. Dựa trên hệ thống này, chi phí thu thập dữ liệu có thể giảm hơn 80% và tăng hiệu quả gấp 3 đến 5 lần, tạo cơ sở cho lượng mưa dữ liệu tương tác thực tế quy mô lớn.
Về phía chất lượng dữ liệu, XTacFlow tự nghiên cứu chịu trách nhiệm lập kế hoạch thống nhất các liên kết thu thập, hỗ trợ truy cập hợp nhất đa thiết bị, căn chỉnh thời gian phương thức mili giây và cho phép hơn 90% dữ liệu trả lại và tự động hóa xử lý hậu kỳ, chuyển đổi dữ liệu đa phương thức thô thành các mẫu dữ liệu và tài sản đào tạo có thể đào tạo, truy xuất nguồn gốc, có thể tái sử dụng.
Cấu trúc dữ liệu TacVerse 1k tương thích với các định dạng dữ liệu robot chính như LeRobot, MCAP, HDF5, ROS2 và chuẩn hóa các trường mở rộng phương thức xúc giác để dữ liệu không chỉ có sẵn trong nội bộ mà còn có cơ sở để chia sẻ, ghép kênh và nhắm mục tiêu theo ngành.
Theo kế hoạch phát hành, bộ dữ liệu 100 giờ đầu tiên của TacVerse 1k sẽ mở các ứng dụng vào ngày 30 tháng 7, bao gồm hơn 40 kịch bản thực tế; Bắt đầu từ tháng 8, các ứng dụng cho bộ dữ liệu 1.000 giờ sẽ được mở và hợp tác mở thông qua các nền tảng như Tháp Alibaba và Hugging Face.
Hướng tới nhiệm vụ ngành nghề thực tế, thúc đẩy quy mô hóa hạ cánh thông minh vật lý
Sự ra mắt đồng bộ của X-TouchMind V1 và TacVerse 1k đánh dấu sự khởi đầu chính thức cho một giai đoạn mới trong ngành.
Thiên Giác tiếp theo sẽ trọng điểm triển khai hợp tác sâu sắc nhiều ngành nghề hướng tới các cảnh như lắp đặt chính xác công nghiệp, lắp đặt điện tử tiêu dùng, lưu thông phân phối mềm, kiểm tra chất lượng thông minh, giám định thật giả sản phẩm tiêu dùng, xây dựng trung tâm dữ liệu, v. v.
"Chúng tôi hy vọng rằng việc phát hành X-TouchMind V1 và TacVerse 1k sẽ tiếp tục mang lại giá trị cho ngành công nghiệp để bắt đầu một giai đoạn mới của ngành công nghiệp'bản địa hóa xúc giác'. ”
Trong tương lai, Chitose sẽ tiếp tục thúc đẩy sự lặp đi lặp lại của công nghệ và khám phá lý thuyết xung quanh "bản địa xúc giác" và "kịch bản thực tế", cùng với sự tiến bộ của ngành.
Robot cảm ứng đầu tiên của VTLA X-TouchMind V1 và bộ dữ liệu đa phương thức đầu tiên TacVerse 1k