Компания Vals, поддерживаемая Andreessen Horowitz, стремится стать эталоном в области бенчмаркинга искусственного интеллекта.
Бенчмаркинг стал отраслевой нормой для компаний, занимающихся искусственным интеллектом, в плане проверки возможностей своих моделей и, когда показатели оказываются в их пользу, позволяет им выделиться среди конкурентов и продемонстрировать свое превосходство. Другими словами, хорошие бенчмарки почти всегда означают хороший пиар.

К сожалению, компании также научились обходить устаревшие системы бенчмаркинга, многие из которых являются устаревшими и не предназначены для оценки возможностей современных моделей.
Компания Vals, стартап, основанный в 2024 году , заявляет о своей миссии по исправлению этой крайне несовершенной системы. Менее чем за два года компания зарекомендовала себя как заметный игрок в технологической индустрии, а в прошлом году ей удалось привлечь посевной раунд инвестиций от 8VC и Bloomberg Beta. Затем, в прошлом месяце, после периода быстрого роста, она привлекла 40 миллионов долларов в рамках раунда серии А, возглавляемого Andreessen Horowitz.
25-летний соучредитель компании Райан Кришнан ранее проходил стажировку в Palantir, а будучи студентом Стэнфорда, работал в Microsoft и в получившей широкое признание лаборатории искусственного интеллекта этого университета. Кришнан говорит, что Vals возникла из его собственных наблюдений за тем, как бенчмаркинг отстает от прогресса отрасли, для измерения которого он и был создан.
«Мы наблюдали, как на рынок быстро появлялось множество новых, очень эффективных моделей, и академические стандарты не успевали за этим прогрессом», — делится Кришнан. Поскольку ИИ интегрируется во все сферы общества, должны существовать стандарты, подтверждающие, что модели способны делать то, что компании рекламируют, считает Кришнан.
На прошлой неделе молодой основатель компании провел для меня экскурсию по своему двухэтажному офису на улице Фолсом в Сан-Франциско — старому кирпичному зданию, которое столетие назад служило местом расположения крупной пивоварни . Вместо промышленного производства пива в этом историческом здании теперь размещается множество стартапов, стремящихся создать будущее технологической индустрии.
«Исторически, я думаю, оценка проводилась для определения интеллекта в очень абстрактной форме, — говорит мне Кришнан. — Например, обладают ли модели достаточными знаниями, чтобы сдать экзамен на получение адвокатской лицензии?»
В этом отношении Vals стремится выделиться. В то время как многие системы бенчмаркинга предлагают общедоступные тесты (это может позволить компании обучать свою модель на основе этих тестов, что, возможно, является обманом на экзамене ), Vals не раскрывает публично свои конкретные тестовые материалы. Вместо измерения общих знаний модели ИИ, Vals также оценивает модели по их способности выполнять сложные задачи, связанные с конкретными отраслями, такими как юриспруденция, финансы и программирование.
«Мы изучаем реальное влияние этих моделей, — сказал Кришнан. — Могут ли они обеспечить результат такого же качества, как и человеческий, во всех областях?»
По его словам, идея состоит в том, чтобы проверить не только положительные, но и отрицательные результаты. Цель – проанализировать, «каковы будут негативные последствия, если эти модели выйдут из-под контроля в мире».
Возможности, которые измеряет Vals, постоянно расширяются. Помимо более традиционных отраслей, стартап продолжает осваивать новые, уникальные области. «У нас есть бенчмарк, основанный на рекурсивном самосовершенствовании. Мы работаем в сфере психического здоровья, кибербезопасности, биобезопасности и даже права вооруженных конфликтов, чтобы разработать модели, позволяющие понять, как применять Женевскую конвенцию», — рассказывает Кришнан.
Компании платят Vals за тестирование своих моделей, что может показаться странной концепцией. Зачем компании платить за то, чтобы узнать, что её модель работает плохо? Но наличие эффективного инструмента измерения помогает компаниям выявлять и устранять проблемы и улучшать свои результаты с течением времени. Кришнан сравнивает их модель получения дохода с тем, как студент может заплатить College Board за сдачу SAT.
В свою очередь, эти оценки становятся ключевыми факторами, влияющими на принятие решений компаниями, стремящимися приобрести новые модели искусственного интеллекта.
Недавно стартап сообщил , что его выручка в восемь раз превышает прошлогодний показатель. Штат сотрудников также растет. Компания Vals, начавшая год всего с восемью людьми, уже утроилась и теперь насчитывает 25 сотрудников. Кришнан сказал, что по мере роста стартапа планируется переезд в значительно больший офис, а также наем еще 10-15 человек. Компания также недавно запустила программу, направленную на предоставление услуг по оценке моделей федеральным агентствам.
Кришнан считает, что разработанная его компанией система сравнительного анализа – это будущее подхода компаний, занимающихся искусственным интеллектом, к развитию бизнеса и укреплению общественного доверия.
«Компании, занимающиеся искусственным интеллектом, начинают выходить на биржу. SpaceX вышла на биржу. Anthropic планирует сделать это позже в этом году. Я подозреваю, что OpenAI скоро тоже выйдет на биржу. Думаю, по мере того, как модели ИИ станут неотъемлемой частью экономики и будут распространяться все шире, используемые нами бенчмарки и оценки будут определять их применение и станут центральной частью того, как эти компании будут представлять отчеты или рассказывать о потенциальных инвестициях в ИИ», — сказал он.





















0 комментариев