예전에 아무차에 핸드폰 달면 자율주행 될거다라고
농담삼아 먼 훗날일것처럼 얘기했는데
이게 진짜 되는군요
드라이빙 벤치 최초로
100퍼센트 주행성공 달성입니다.
jev로 증류하면 진짜 자율주행 될수도 있을것 같기도 하네요
테슬러처럼 데이터 모으고 뻘짓 할 필요없이 agi가 나오면 자율주행은 그냥 된다는게 마냥 허언은 아닐 듯 하네요. 이래서 그렇게 견제를 했나 싶기도요ㅎㅎ
아스트라는 미니agi가 아닌가 싶습니다ㅎㅎ
예전에 아무차에 핸드폰 달면 자율주행 될거다라고
농담삼아 먼 훗날일것처럼 얘기했는데
이게 진짜 되는군요
드라이빙 벤치 최초로
100퍼센트 주행성공 달성입니다.
jev로 증류하면 진짜 자율주행 될수도 있을것 같기도 하네요
테슬러처럼 데이터 모으고 뻘짓 할 필요없이 agi가 나오면 자율주행은 그냥 된다는게 마냥 허언은 아닐 듯 하네요. 이래서 그렇게 견제를 했나 싶기도요ㅎㅎ
아스트라는 미니agi가 아닌가 싶습니다ㅎㅎ
인간은 운전을 위해 수억마일의 데이터와 케이스가 필요하진 않으니까요
인간수준의 인공지능은 그정도의 주행데이터가 필요없을 수 있죠ㅎㅎ
인간은 운전을 금방 배우지만 자율주행이 어려운 이유는 인간이 겪지 않아도 될 온갖 '비정형 예외 상황(Corner case)'을 기계가 완벽히 대응해야 하기 때문이고,
벤치마크 테스트와 실제 복잡한 도심 도로는 차원이 다르지 않을까요?. 이 연구도 실제 도심에 적용해보면 결국 데이터 부족의 한계에 부딪힐 가능성이 크죠. 단편적인 벤치마크 결과만으로, 막대한 실주행 데이터를 직접 축적해온 방식을 '뻘짓'이라 단정 짓는 건 다소 섣부른 시선 같습니다.
1.이미 빅테크들이 이세상의 모든 데이터를 넣어 만든게 llm이고
2.고차원의 데이터는 하위 데이터를 무의미하게 만들수 있고
3.월드모델이나 재귀개선이 가능하면
막대한 데이터 까지는 필요없을수 있고
4.막대한 실주행 데이터도 이미 oai가 집어넣어놨을 수 있습니다.ㅎㅎ
2억키로 주행연습한 침팬지보다
1만키로 연습한 성인 인간이 나을 수 있습니다..ㅎㅎ
최첨단 기술이라는 그럴싸한 마케팅에 휘둘리고 선동 당해,
생존 본능 없는 기계에게 목숨이 하나밖에 없는 인간이 운전대를 대범하게 맞기는 행위같습니다.
로봇도 자율주행과 마찬가지로 두뇌가 가장 중요할텐데요.쉽진 않아보입니다.
FSD 는 온보드 AI 입니다...
작년보다
같은 지능대비 토큰값이 1800배 하락했다는 얘길 어디서 본것 같네요.
작년 제작년 프론티어모델급 성능이 현 로컬로 돌아가긴하죠.ㅎㅎ
실제로 나중에 되게 하려면 Online AI와 On Premise AI가 결합된 형태가 되어야 하겠죠.
제생각에..
발전 추세로 볼땐 1-2년안으로는
오픈파일럿 같은거에서 그냥 될 것 같네요.
지금 제일 발전했다는 FSD도 보험이 비싸거나 가입 받아주는 보험사들이 적은데 AI 기반으로 자율주행하는 차를 받아주는 보험사도 1, 2년 사이에 나올리가 없구요.
자동차 출시 전에 주행테스트를 최소 1년 이상 국내외에서 하고 개발과정에서 그렇게 많은 검증을 함에도 출시하고 버그가 많은데 chatgpt로 이게 그렇게 짧은 기간 안에 될 수가 없습니다.
기술적으로 가능하다는 의미입니다.
오픈파일럿은 미국에서 팔리고 있습니다.
우리나라는 규제때문에 안되겠죠
https://drivingbench.com/trace/gpt-6-astra/2/
그렇죠. 말그대로 코덱스에게 사진전송하면서 그냥 시킨거니까요ㅎㅎ
입츌력 최적화가 전혀 안되어 있습니다.
의미는 있다고 봅니다만 아직 FSD랑 비교하기엔 갈길이 아주 멀죠.
알파마요도 언어모델 기반입니다.ㅎㅎ
반응속도는 운전가능 수준이죠. ㅎㅎ
증류는 oai에게 그렇게 어려웠던 일은 아닙니다.
선생님 이미 vla llm기반 알파마요란게 있습니다..
알파마요는 자동차용 주행칩셋인 토르칩에서 돌아가는데요.
뭐 문제가 있나요?
온디바이스로 굴리려면 차한대 사이즈가 트럭이상이 되어야하며 가격이 수십 수백억이 되어요.
선생님
알파마요는 차량내탑재된
오린 토르 로컬칩에서 돌아갑니다.
상식이 탑재되어 있습니다.
관련지식 업데이트가 조금 안되어 있으신것 같으니 gpt에 관련 문의를 해보시기 바랍니다.
gpt pro 20x 구독중이고 로컬도 굴리고 학습도 시키고 증류도 하고 로라도 만들고 풀스택 개발도 합니다ㅎㅎ
지금은 프론티어가 상대가 안되게 좋아져서 걍 구독모델만 씁니다.
시승좀…
지금껏 1년에 1800배씩 토큰비용하락 했다는 얘기가 있습니다.
일단 현재도 딱히 테슬라가 데이터 우위에 있는건 잘 모르겠습니다. 주행데이터는 중국이 최고일거라 생각합니다.
새로운 패러다임이 나와서 파쇄하는건 바램이 아니라 그냥 벌어지고 있는 일입니다.
그리고 딱히 새로운 패러다임은 아닙니다.ㅎㅎ
로봇제어 쪽에서 아스트라의 수행성공률이 자체데이터로 학습한 경우보다 높으니까요.
뭐.. 번역ai보다 gpt보다 번역을 잘하는 것과 마찬가지의 현상이라 봅니다.
큰모델이 모든걸 집어삼키는 현상이죠.
번역을 삼켰고
수학을 삼켰고
코딩을 삼켰고
이제 물리를 삼킬 차례죠ㅎㅎ
이것들은 제 바램이 아닙니다. 그냥 벌어지고 있는 일이죠..
agi가 운전자에 맞는 운전모델 설계해서 룰베이스 기반에 보조 신경망AI으로 만들어 주게 되는거 아닌가요...?
저희는 운전을 하는 AI를 제작하는 AI를 제공합니다!! 입맛에 맞게 제작하는 ai!
매일 저녁 요청을 하시면 밤새 제작해서 아침에 설치해드립니다!
"이제 너는 384년간 무사고 운전한 운전자이다. 사고나지 않게 운전해줘."
"이제 너는 전직 F1선수다. 그랑프리 우승 200회에 빛나는 프로다. 사고를 내지 않지만 가장 빠르게 운전해줘."
공도에는 가지고 나오지 마세요.
gpt가 2년전에는 산수도 못했죠
지금은 밀레니엄 문제를 풀지만 말입니다ㅎㅎ
ChatGPT는 지난 2년간 연산능력인 TOPS는 많이 증가했지만 응답속도 레이턴시는 2년간 45% 정도만 빨라졌죠.
시속 2km에서 140km로 발전하려면 레이턴시가 80배 줄어들어야 하는데 GPT는 연산능력 향상이 발전방향이지 레이턴시 감소는 주요 목표가 아니죠.
전용 자율주행 연산 모델들은 이런 레이턴시 절감을 기본으로 깔고가기에 기본부터 차이가 납니다.
역도선수에게 100m 기록을 요구하는 것 같겠네요.
향후 GPT가 100배 레이턴시 감소 발전목표가 생긴다면 또 모르겠지만요.
기술적으로 불가능이 아닌게
이미 운전이 가능할 정도로 반응속도가 빠른 알파마요가 있고 jev가 있습니다.
oai는 로봇, 피지컬ai도 연구하고 있기에 기술력이 없다기보다는
현재 반응빠른 모델을 굳이 서비스 하지 않고 있을 뿐이다라고 개인적으로 생각합니다.
하지만 수요에 의해 조만간 나올거라고 생각하고 있어요
그래서 알파마요나 피지컬AI 같이 데이터축적을 전제로한 레이턴시 감소용 전용 모델이 따로 나온거죠.
GPT에 레이턴시 절감 목표가 생기지 않는다면 전용 모델의 영역에 발을 딛을 예정이 없겠죠.
그 방향성을 바꿀 조만간의 수요라는 것이 과연 전용모델의 로컬속도와 가성비를 초과하는 조만간이 도례할지는 두고볼 일이겠지만 아직 어디도 단서는 묘연한것 같네요.
먼 후년이라면 상업적인게 아니라면 가능할수도 있겠지만요.
양산과 자율주행이 뭔상관인지는 모르겠으나...
오픈파일럿은 다양한 차종에서 잘 돌아가긴 합니다.ㅎㅎ
단편보다 추세를 봐야죠.
실패와 100퍼센트 성공은 의미가 엄청나게 다릅니다.
추세는 이미 드라이빙 벤치 기록에 나와있습니다.
gpt 5.6sol 6퍼센트
gpt 6 100퍼센트
두달만에 6->100으로 벤치가 포화되었고 다른 벤치가 생기겠죠.
그 벤치가 포화되는 시간이 얼마나 걸릴까요.
동일한 실험 환경에서 서로 다른 모델을 대조한 단일 비교 데이터입니다. 같은 이름의 다른 버전 모델 결과가 있는걸보고 기술 진보 추세로 보다니요...
거의 대부분의 벤치마크가
다른버전의 결과를 보고 기술 추세를 파악 할텐데요. 아닌게 있나요?
데이터 그자체로 읽어야 한다는게 무슨말인가요
무슨말씀이신가요
5.6은 두달전 7.9일 롤아웃 된 모델입니다.
6.0은 9월 초 출시된 모델입니다.
벤치마크에 모델이 개선되었다는 얘기를 왜쓰나요
벤치는 각 버전과 모델들의 점수를 매길뿐입니다.
점수의 변동이 개선을 의미합니다
무작정 문제를 제기하지 마시고 님의 생각을 쓰도록 해보세요.
모델 발전 추세를 보려면 벤치를 고정해야죠. 같은 환경과 같은 과제를 구버전과 신버전에 돌려 성능 차이를 보는 게 기본적인 비교 방법입니다.
두달전 출시 모델과의 비교이니 두달만에를 얘기하는거고요. 모든 벤치가 그렇게 추세를 파악합니다.
아닌 벤치가 있나요?
논문의 일반적인 구성에는 내 가정에 대한 결과를 실험으로 입증해서 데이터로 정리하게 됩니다. 그 데이터는 내 가정을 입증하기 위한 용도인데, 갑자기 내 가정과 실험이 벤치마크가 되진 않습니다.
벤치마크는 그 객관성이나 목적이 입증이 되야 결과도 활용할 수 있는건데, 내가 아무 응용프로그램을 만들어서 결과를 보여주고 이 모델 성능이 떨어진다 또는 개선됐다 말하면 어떨까요?
CARLA Leaderboard, Bench2Drive, LMDrive 같은 자율주행 벤치도 정해진 환경에서 코스를 돌리고 결과를 재는 방식입니다.
DrivingBench도 고정 코스, 고정 프롬프트와 도구, 진행률 산식, 평가 프로토콜, 전체 trace까지 공개해 놨고요.
벤치마크라고 해서 수백 수천개 테스트가 있어야 하는게 아닙니다.
AgencyBench V1도 10개 task
AI4AI-Bench나 FT-Bench도 10개
AIRS-Bench도 20개 task 수준입니다.
님이 생각하는 벤치마크와 간단한 실험의 기준은 정확히 뭔가요?
본인이 생각하는 벤치마크 기준이 있다고 해서 그 기준이 일반적으로 통용되는 기준은 아니죠.
논문에 당당하게 쓸 수 있느냐
를 벤치마크의 기준으로 잡으면 살아남을 벤치가 거의 없죠.
지금 평가기준으로 통용되고 기준으로 쓰이고 있는 다른 벤치들 조차 논문에 살아남을 벤치는 거의 없습니다.
벤치마크는 처음부터 권위가 붙어있는게 아니라, 평가 조건이 명확하고 재현 가능해서 여러 사람이 쓰고 인용하면서 신뢰도가 쌓이는겁니다.
처음 나온 벤치에다 대고 이걸 논문에 당당하게 쓸 수 있냐를 기준으로 자격을 따지면, 신규 벤치마크는 애초에 생길 수도 없습니다
그리고 벤치마크는 누가 정해놓은 자격시험 같은게 아닙니다.
같은 조건에서 반복 비교할 수 있도록 실험이 통제돼 있고, 평가 기준 명확하고 다른 사람들이 그 결과를 참고하거나 반복해서 사용하면서 벤치마크로 자리잡는거죠.
중요한건 통제된 비교가 가능한가 재현 가능한가 그 평가가 실제로 얼마나 채택되고 활용되느냐지
얼마나 거창하게 논문에 인용되느냐 아니냐가
벤치마크냐 간단실험이냐 의 기준이 아닙니다.
대부분의 벤치의 가치는 통제된 환경에서 비교 가능하냐와 사람들이 얼마나 관심을 가지고 있고 활용하냐에 있습니다.
당연히 '이런 것도 된다' 와 '아스트라만 가능했다' 정도를 보여주는 수준이지만
범용모델의 가능성을 보여주는 테스트였다고 생각합니다.
얼마나 빠른 시간에 많은 정보를 받을 수 있고, 정확한 판단을 빠른 시간에 내서, 제어를 할 수 있고 그에 따른 추가적인 피드백 정보도 종합해서 그 다음 판단을 예측하고 준비할 수 있는지가 더 중요하죠. 거기다가 또 다른 예외상황에 대한 대비도 계속 하면서요.
단순히 주행속도가 느리다. 이런 트집을 잡으려고 얘기하는건 아니구요.
위 사항을 해결하려면 아무리 기술 발전으로 판단을 위한 토큰이 저렴해진다고 해도 물리적인 반응속도 자체가 존재하기에 서버 - 클라이언트 베이스로는 절대 불가능하고, 그런 문제를 해결하기 위해 로컬성능 빵빵하게 해서 달아둔다 해도, LLM AI들 목표가 언제나 다양하게, 똑같지 않되 정답을 찾아가기 위해 랜덤성도 일부로 주고 하니 딜레이는 존재합니다.
더군다나 주행과 관련 없는 정보까지 가지고 있어 할루시네이션도 있기 마련이고...
그렇게 결국 자율주행을 위해 특화하여 케이스를 주고, 데이터를 주고, 해서 모델을 만들면.,.. ? 테슬라 FSD가 있네요.. 가 되버리는거죠.
그래서 짜잔 jev란게 나왔습니다
그리고 알파마요도 행동제어 출력이 따로 있습니다. 반응속도가 빠르죠ㅎㅎ
찍어서 맛을 봤으니 이것도 얼마 안남았습니다.
테슬라의 FSD는 pre-training없이 reinforced-learning의 결과물이기에, 빅테크의 AI 모델이 인간이 운전면허를 딸 수 있는 나이의 일반지식을 습득한다면, 운전에 대한 reinforced-learning 결과물을 내놓는 것은 어렵지 않겠죠. 그래서, AI 프론티어에서는 결국 모델의 성능은 차이가 없을 것이며 최종 승자는 infra일 것이다라고 하는데, 좋은 회사가 많은 인재를 보유하듯이 좋은 모델을 동시에 많이 구동 시킬 수 있는 인프라를 소유한 기업/국가가 최종 승자가 되지 않을 까 합니다.
동감합니다.
저 분의 글에서 말하는 pre training은 맥락상 운전 영상을 미리 학습한다가 아니라 그보다 위단계의 범용지능과 세계이해를 먼저 만들어 놓는다는 의미로 쓰인 것으로 이해됩니다
foundation learning이라고 이해하면 될 것 같습니다.